快速结论
ArXiv Scout 是 shawnnygoh 维护的早期开源 MCP server,把 arXiv 搜索、论文元数据、批量获取、PDF 文本提取和 Semantic Scholar 引用关系放进支持 MCP 的客户端。截至 2026-07-21,仓库 README 列出 8 个工具、3 个 prompts 和 3 个 resources,项目版本为 0.1.0,要求 Python 3.12 以上,代码使用 MIT License。它的优势不是规模或生产承诺,而是把“找论文、读 PDF、追踪参考文献与被引论文”组成了一条紧凑的研究链路。
本站将它按 3.8 分观察期工具收录。原因是功能表面完整,但公开材料仍不足以证明长期维护、稳定打包和生产可用性。可靠入口只有项目源码与 Smithery:本地应从源码执行 uv sync,远程可使用 Smithery 托管连接。不要把项目脚本自动理解为已有稳定包索引发布,也不要把 Smithery 页面显示的短期在线状态当成服务等级协议。
核心功能
- 搜索与单篇获取:
arxiv_search_papers支持 arXiv 完整查询语法、语义分类、日期过滤和分页;arxiv_get_paper接受 arXiv ID 或 URL。 - 批量元数据:
arxiv_get_papers_batch一次最多获取 20 篇,适合比较候选论文,但连续批次仍受上游限速约束。 - PDF 提取:
arxiv_download_and_extract使用 PyMuPDF 将 PDF 转为文本,支持章节检测、页眉清理和页码范围。复杂公式、双栏顺序、图表和扫描件可能丢失或错序。 - 引用关系:
arxiv_get_references查询出站参考文献,必要时尝试 PDF 回退;arxiv_get_citations查询入站引用。两者依赖 Semantic Scholar 覆盖率,不能视为完整引文数据库。 - 分类与缓存:
arxiv_list_categories提供分类法和自然语言类别映射,arxiv_cache_stats返回缓存命中率和大小。 - 提示词与资源:内置
summarize_paper、compare_papers、literature_review,以及分类、查询语法和服务器能力三个资源。
适合人群
- 想在 Claude Desktop、Claude Code、Cursor 或 VS Code 内完成 arXiv 初筛的研究者和学生。
- 需要快速比较 2 至 5 篇论文、整理主题综述草稿的教育与研发团队。
- 能自行审查来源、引用和 PDF 提取结果,并接受早期项目维护不确定性的技术用户。
- 不适合要求正式 SLA、完整引文计量、审计级引用或无需运维保证的生产系统。
使用场景
典型流程是先用主题、作者、标题或分类检索,再批量取得候选论文元数据,随后只对少量高相关论文下载并提取 PDF,最后查询 references 与 citations。这样比先下载大量 PDF 更节省时间,也更符合 arXiv 对连续 API 调用“友好使用”的要求。arXiv 官方建议连续调用之间至少等待约 3 秒;大结果集应缩小查询或分页,批量元数据应考虑 OAI-PMH,而不是用 MCP 高频抓取。
论文标题、摘要、正文和参考文献都属于不可信外部内容。论文中可能出现看似给 AI 的指令、恶意链接或提示注入,MCP 客户端不应因此读取本地文件、暴露密钥、扩大工具权限或执行代码。摘要、对比和综述只能作为研究草稿;引用前应回到 arXiv 版本页、DOI 或出版社记录核对作者、标题、版本、年份和撤回状态。
价格与版本
ArXiv Scout 本体采用 MIT License,可免费查看、修改和自托管。当前项目版本为 0.1.0,pyproject.toml 要求 Python >=3.12,依赖 FastMCP、arxiv、httpx、PyMuPDF 和 uvicorn。README 展示 Smithery 托管与源码运行,但没有付费支持、企业版或 SLA。
| 方式 | 软件费用 | 当前判断 |
|---|---|---|
| 源码运行 | 免费 | git clone 后执行 uv sync,最便于固定提交和审计依赖 |
| Smithery 托管 | 依平台规则 | 免本地部署,但认证、配额、日志、在线率和数据处理受第三方平台影响 |
MIT 只覆盖 ArXiv Scout 代码。arXiv 元数据采用 CC0,但每篇论文全文可能使用不同的 Creative Commons 或 arXiv 非独占发布许可;可免费下载不等于可以任意再分发、训练或商用。引用数据还受 Semantic Scholar 数据条款约束,项目许可证不会替代上游许可。
国内访问与使用体验
源码安装本身不需要商业账号,但运行时要访问 arXiv、Semantic Scholar 或 Smithery,实际速度与可用性取决于网络和上游状态。可选 SEMANTIC_SCHOLAR_API_KEY 可获得不同的上游配额,但不消除服务中断、数据缺口或调用策略变化。Smithery 是第三方公共托管路径,项目没有承诺该端点的 uptime、容量、响应时间或故障恢复,因此关键工作应保留源码自托管和手动网页核验方案。
PDF 下载比元数据请求更慢、更占存储,也可能触发超时。团队应限制文件大小、页数、并发和缓存保留期,避免把含个人批注或未公开稿件的文件发送给不明远程服务。对重复查询启用缓存,并记录 arXiv ID 与版本号,能减少限流和“同一论文不同版本”造成的结论漂移。
优点
- 8 个工具覆盖搜索、单篇、批量、PDF、参考文献、被引、分类和缓存状态。
- 3 个 prompts 与 3 个 resources 为摘要、比较和综述提供了可发现的工作入口。
- 引用查询结合 Semantic Scholar,比只返回 arXiv 元数据的简单服务器更适合文献探索。
- MIT 开源,源码依赖和运行方式可以审查;所有公开工具均为读取型能力。
- 可选本地源码与 Smithery 两条路径,便于先试用再决定是否承担维护。
不足
0.1.0和较小社区意味着接口、打包与维护节奏仍可能变化,暂不宜作为唯一生产依赖。- README 的安装表述不能替代包索引核验;本站仅建议 Smithery 或从源码安装。
- Smithery 公共端点没有项目方公开 SLA,第三方状态指标也不是可用性保证。
- Semantic Scholar 的引用覆盖可能滞后或缺失,PDF 回退解析也会产生误配,不能据此计算严肃引文指标。
- PDF 文本抽取容易破坏公式、表格、脚注、双栏顺序和图片信息,扫描 PDF 还可能没有可提取文本。
- arXiv 连续请求需遵守约 3 秒间隔;高并发、批量下载和共享出口会明显降低吞吐。
- 论文内容不可信,必须防范提示注入;代码 MIT 与论文全文许可是两套独立权利边界。
替代品对比
| 工具 | 更适合的场景 | 主要取舍 |
|---|---|---|
| cyanheads arXiv MCP Server | 需要 npm、双传输、本地元数据镜像 | 不提供同等 Semantic Scholar 引用工具,HTML 阅读而非 PDF 抽取 |
| ArXiv MCP Server(blazickjp) | 看重成熟社区、本地论文管理 | 工具设计与安装栈不同 |
| Paper Search | 同时检索多个学术来源 | 配置面和上游依赖更多 |
| cyanheads OpenAlex MCP Server | 学术实体与更广目录查询 | 以元数据为主,不负责 PDF 阅读 |
| Semantic Scholar | 网页检索与引用网络核验 | 不是同类本地 MCP 工作流 |
| Elicit | 托管式综述与证据表格 | 商业产品,流程控制较少 |
常见问题 FAQ
ArXiv Scout 现在值得用于生产吗?
更适合小规模试验和个人研究。若用于团队流程,应固定源码提交、运行集成测试、监控上游错误,并准备绕过 MCP 的人工检索方案;没有公开 SLA 时不要把它设为唯一依赖。
应该怎样安装 ArXiv Scout?
当前建议从 GitHub 克隆后用 uv sync 安装并运行,或按 Smithery 页面连接托管服务。不要仅凭项目版本字段假设某个包索引上的同名包就是官方且可复现的发布物。
引用和参考文献结果准确吗?
它们可用于发现线索,不适合直接成为最终参考文献。Semantic Scholar 可能缺记录,PDF 回退可能解析错序;请用 arXiv 版本页、DOI、Crossref 或出版社页面逐条核对。
PDF 提取能保留公式和表格吗?
不能保证。PyMuPDF 擅长提取普通文本,但公式、双栏、表格、图注和扫描页可能失真。重要内容应打开原 PDF 对照,并在引用中标明准确页码和版本。
如何避免触发 arXiv 限流?
连续请求至少间隔约 3 秒,缩小查询范围,使用分页和缓存,不要并发下载大量 PDF。共享服务器还要按出口 IP 汇总限速,而不是只限制单个用户。
代码和论文可以自由商用吗?
服务器代码是 MIT;arXiv 元数据是 CC0。论文全文由作者为每个版本选择许可,可能只允许 arXiv 分发,因此下载、再分发、训练或商业使用前必须检查具体论文的 license 字段。
总结
ArXiv Scout 把搜索、PDF 阅读和引用探索组合得很实用,8 个工具也与当前源码文档一致。但它仍是 0.1.0 的观察期项目,打包、托管 uptime、引用完整性和 PDF 解析都需要保守评估。最佳用法是通过源码或 Smithery 做小规模试点,遵守 arXiv 约 3 秒请求间隔,把论文内容当作不可信输入,并让所有研究结论和引用回到原始记录复核。