一个以 Obsidian 为界面的科研人员与合作网络归档模板。
仓库只保存空模板、管线和示例输入;真实人物档案、论文 PDF、运行产物和研究报告应保留在本地,不提交到 GitHub。
输入 1–20 个 arXiv/DOI 链接,管线会按以下链路生成本地 vault 数据:
- 解析 seed → 论文元数据
- 采集作者、代表论文和合作边
- 按深度、合著次数、引用数和人数上限递归筛选
- 生成
人物/档案与关系图谱/网络 - 生成覆盖率/孤点校验报告
- 将本轮产物归档到
runs/<iter>/output/
默认管线使用 OpenAlex,并以 Semantic Scholar 作补充。若需避开 OpenAlex,可使用项目内的 scripts/s2_pipeline.py;该脚本也会生成同样的本地人物与合作图谱。
cp inputs/seeds-1paper.json /tmp/my-seeds.json
# 编辑 /tmp/my-seeds.json;或将输入文件放入 inputs/ 后使用
env no_proxy='*' NO_PROXY='*' http_proxy= https_proxy= HTTP_PROXY= HTTPS_PROXY= \
python3 scripts/pipeline.py \
--seeds inputs/seeds-1paper.json \
--iter 0015 篇示例:
env no_proxy='*' NO_PROXY='*' http_proxy= https_proxy= HTTP_PROXY= HTTPS_PROXY= \
python3 scripts/pipeline.py \
--seeds inputs/seeds-5papers.json \
--iter 002 \
--max-depth 2 \
--max-people 500长任务在本地后台运行:
env no_proxy='*' NO_PROXY='*' http_proxy= https_proxy= HTTP_PROXY= HTTPS_PROXY= \
nohup python3 scripts/pipeline.py \
--seeds inputs/seeds-5papers.json \
--iter 002 \
> runs/002/worker.log 2>&1 &运行前请阅读 AGENTS.md、QUEST.md 和 .agents/skills/scientists-archive/SKILL.md。
{
"seeds": [
"https://arxiv.org/abs/1706.03762",
"https://doi.org/10.xxxx/example"
]
}支持:
https://arxiv.org/abs/<id>https://doi.org/<doi>
超参通过启动 prompt 或 CLI 传入,不使用磁盘 task config:
--max-depth:递归深度,默认2--max-people:入库人数上限,默认500perDepthRules、undergradFilter、portrait.segmentYears:由 worker 启动 prompt 按QUEST.md默认值解释
人物/ 本地人物档案(Git 忽略)
关系图谱/ 本地合作网络(Git 忽略)
论文/原文/ 本地 PDF(Git 忽略)
reports/ 本地校验报告与精读报告(Git 忽略)
runs/ 本地运行日志和快照(Git 忽略)
inputs/ 可提交的脱敏示例输入
scripts/ 可复用管线
模板中保留 .gitkeep,确保空目录结构在克隆后存在。运行生成的真实数据不会被 Git 追踪。
- 不要提交人物档案、论文原文、运行日志、研究报告、API token 或浏览器 cookie。
inputs/中只放公开且脱敏的 seed;个人任务输入建议放在/tmp。- 代理环境下运行 arXiv 请求时,使用上面的
no_proxy前缀,避免系统代理返回错误页面。
python3 -m py_compile scripts/pipeline.py
python3 scripts/pipeline.py --help见 LICENSE。