快速结论
cyanheads 维护的 arXiv MCP Server 是面向 Claude、Cursor、VS Code 等 MCP 客户端的只读学术检索服务。截至 2026-07-21,npm 包 @cyanheads/arxiv-mcp-server 当前版本为 v1.2.15,采用 Apache-2.0 License,提供 4 个 tools 和 2 个 resources,可通过 stdio 本地运行,也可通过 Streamable HTTP 自托管。它适合搜索 arXiv、按 ID 批量取元数据、读取可用的 HTML 全文和查询分类,不是引文管理器、同行评审数据库或保证 PDF 全文解析的文献平台。
项目还提供公共端点 https://arxiv.caseyjhand.com/mcp 和可选 SQLite + FTS5 元数据镜像。公共端点适合快速试用,但仓库没有承诺 uptime、容量、数据保留、支持响应或 SLA,生产流程应自托管并监控。镜像可以减少搜索和元数据请求对实时 API 的依赖,却不会镜像论文全文;arXiv 数据政策不允许把该能力理解为任意批量抓取全文。
核心功能
arxiv_search:支持ti:、au:、abs:、cat:、all:字段与AND、OR、ANDNOT,可按分类、相关性、提交或更新时间筛选和排序,每次最多返回 50 条。arxiv_get_metadata:一次最多按 10 个新版或旧版 arXiv ID 获取元数据,并分别报告未找到的条目。arxiv_read_paper:优先读取 arXiv 原生 HTML,失败时回退 ar5iv;将 MathML 压缩为 LaTeX 形式,但返回的是原始 HTML,不是结构化论文解析。arxiv_list_categories:提供约 155 个分类和 8 个顶级组的静态分类法,可按 group 过滤。- 2 个 resources:
arxiv://paper/{paperId}返回论文元数据,arxiv://categories返回分类法。 - 双传输与鉴权:同一代码支持 stdio 和 Streamable HTTP;自托管 HTTP 可配置 none、JWT 或 OAuth。
- 限速与重试:默认请求间隔 3000ms,遇到限流按 5、10、20、30 秒冷却并遵守
Retry-After。 - 可选本地镜像:OAI-PMH 初始化后写入 SQLite + FTS5,为搜索和元数据提供本地查询;全文仍走在线内容源。
适合人群
- 需要在 MCP 对话中精准搜索 arXiv,并能使用字段与布尔语法的研究者。
- 想把少量论文元数据或 HTML 正文交给 AI 做初步摘要、比较和问题定位的学生与研发人员。
- 愿意自托管、固定 npm 版本、记录 arXiv ID/版本并执行来源复核的技术团队。
- 有较多重复元数据查询、能够承担约数小时首次收割和 SQLite 运维的团队。
- 不适合需要完整引用图谱、出版社定稿、审计级文献管理或公共托管 SLA 的场景。
使用场景
对于主题调研,可先用 arxiv_list_categories 找到分类,再用 arxiv_search 缩小到几十篇候选,随后按 ID 批量获取元数据,只读取少量高相关论文。对于固定论文,可通过 resource 或 arxiv_get_metadata 保存版本化 ID,以免论文更新后摘要和内容发生变化。镜像更适合重复搜索与元数据查询,不应为了单次任务承担冷启动收割成本。
arXiv 官方建议连续 API 调用之间至少等待约 3 秒,大结果集应缩小范围或使用不超过 2,000 条的切片,批量元数据则使用 OAI-PMH。该 server 默认 3 秒队列符合交互式调用习惯,但多用户共享一个出口 IP 时仍会串行排队。不要通过降低 ARXIV_REQUEST_DELAY_MS 绕过上游规则;应缓存重复查询、限制并发,并对 429 或临时错误执行退避。
论文 HTML、摘要与链接是不可信内容。其中可能出现提示注入、伪造指令、恶意 URL 或未经同行评审的错误结论。MCP 客户端不能因为论文文本要求就访问密钥、本地文件或其他工具。该 server 也不生成经过核验的参考文献格式;引用前要检查版本页、DOI、作者顺序、发布日期、期刊信息和撤稿状态。
价格与版本
软件本体免费,v1.2.15 已发布到 npm,包要求 Node.js >=24.0.0 或 Bun >=1.3.0,许可证为 Apache-2.0。可用 bunx @cyanheads/arxiv-mcp-server@1.2.15 固定版本,或下载项目提供的 MCPB、使用 Cursor/VS Code 安装入口、从源码构建及运行 Docker。固定版本比直接使用 latest 更利于生产回归。
| 方式 | 软件费用 | 关键边界 |
|---|---|---|
| npm/Bun stdio | 免费 | 本地进程,适合个人客户端;运行环境与升级由用户维护 |
| 自托管 HTTP/Docker | 免费 | 可配置鉴权和观测;服务器、存储、证书、备份与告警自付 |
| 作者公共端点 | 免费试用 | 无安装,但没有公开 SLA、容量和支持承诺 |
| SQLite 元数据镜像 | 免费功能 | 初次顺序收割 README 估算约 4.4 小时;磁盘、刷新与完整性检查自理 |
Apache-2.0 只覆盖 server 代码。arXiv 元数据为 CC0,但论文全文由作者对每个版本选择许可,可能是 CC BY、其他 Creative Commons 或 arXiv 非独占发布许可。免费访问不代表可以任意再分发、训练或商业利用,使用正文前必须检查具体论文版本的 license。
国内访问与使用体验
needsVPN: false 只表示项目代码与基础入口通常可直接尝试,不保证 arXiv、ar5iv、npm 或公共 MCP 端点在任意地区、运营商和时段都有稳定速度。公共端点是作者提供的便利实例,不应从“当前能连接”推导出 SLA。生产系统应自托管,设置健康检查、请求超时、错误率和上游 429 告警,并保留直接打开 arXiv 页面的人工作业路径。
arxiv_read_paper 读取 HTML,不下载和解析 PDF。原生 HTML 不可用时会尝试 ar5iv;仍不可用就可能无法提供正文。即使 HTML 可读,公式、复杂表格、图片和附录也可能与 PDF 表现不同。处理医学、金融或安全论文时尤其需要打开原 PDF 和后续正式出版版本核对,不应把预印本或模型摘要当作专业结论。
优点
- v1.2.15 有 npm 可验证发布,版本、运行时要求和 Apache-2.0 许可清晰。
- 4 个工具与 2 个资源职责集中,查询参数和错误边界比“大而全”服务器更易审计。
- stdio 与 Streamable HTTP 共用代码,可从个人客户端平滑迁移到自托管服务。
- 默认 3 秒请求队列、退避与
Retry-After支持尊重 arXiv API 规则。 - 可选 SQLite + FTS5 镜像能降低重复搜索和元数据查询的在线依赖。
- 原生 HTML 到 ar5iv 的回退比只返回 PDF URL 更便于 LLM 阅读。
不足
- 公共端点没有公开 SLA、容量、隐私或支持承诺,不适合作为唯一生产基础设施。
- 只提供 4 个工具,不含引用图谱、标准参考文献导出、同行评审状态判断或跨库去重。
arxiv_read_paper只处理 HTML;PDF-only 论文、扫描内容、图表与复杂公式可能无法可靠读取。- 本地镜像只解决搜索和元数据,初始收割耗时且需要磁盘、刷新、备份和完整性检查。
- 镜像 FTS5 BM25 与 arXiv 在线相关性排序不同,最近论文还可能存在刷新时间差。
- Node 24 或 Bun 1.3 的运行时门槛高于一些旧环境,升级需做 MCP 客户端兼容测试。
- 论文内容可能提示注入;代码许可、元数据许可和全文许可不能混为一谈。
替代品对比
| 工具 | 更适合的场景 | 主要取舍 |
|---|---|---|
| ArXiv Scout | PDF 提取和 Semantic Scholar 引用探索 | 0.1.0 观察期项目,打包与托管成熟度较低 |
| ArXiv MCP Server(blazickjp) | 大社区、本地论文管理和 Python 工作流 | 工具命名、存储和部署方式不同 |
| Paper Search | arXiv 之外的多学术来源检索 | 上游和配置更多,故障面更大 |
| cyanheads OpenAlex MCP Server | 跨 works、authors、institutions 的学术图谱 | 以元数据为主,不读取论文正文 |
| cyanheads PubMed MCP Server | 生物医学检索、MeSH 和开放全文链 | 学科范围更窄且受 NCBI 等上游约束 |
| Consensus | 无需部署的证据型网页搜索 | 商业托管产品,控制与复现路径不同 |
常见问题 FAQ
cyanheads arXiv MCP Server 当前版本是什么?
截至 2026-07-21,npm 可核验版本是 @cyanheads/arxiv-mcp-server@1.2.15。生产配置建议固定该版本并在升级前检查 changelog 与工具 schema。
公共端点可以直接用于生产吗?
不建议直接依赖。仓库提供 https://arxiv.caseyjhand.com/mcp 方便试用,但没有公开 SLA、容量、支持响应或数据保留承诺。关键流程应自托管并监控。
它能读取所有 arXiv PDF 吗?
不能。arxiv_read_paper 读取 arXiv 原生 HTML并回退 ar5iv,不是 PDF 提取器。没有 HTML 的论文、扫描页和复杂版式可能只能回到原 PDF 人工阅读。
如何遵守 arXiv API 限速?
保留默认 3000ms 间隔,缓存重复结果,对 429 和临时错误退避。大结果集应缩小查询或用 OAI-PMH,而不是提高 MCP 并发。
本地镜像是否包含论文全文?
不包含。镜像存储 OAI-PMH 元数据并用 SQLite + FTS5 搜索,arxiv_read_paper 仍访问在线内容源。它优化元数据吞吐,不是全文仓库。
Apache-2.0 是否意味着论文也可自由商用?
不是。Apache-2.0 适用于服务器代码,元数据是 CC0,全文许可则逐论文、逐版本决定。再分发、训练和商业使用前必须检查论文自己的许可。
总结
cyanheads arXiv MCP Server v1.2.15 是一个边界清晰的 arXiv MCP:4 工具、2 资源、双传输、合规限速和可选元数据镜像,适合技术用户搭建可控的论文发现与 HTML 阅读流程。它不能替代引文管理、PDF 解析或同行评审,也不为公共端点提供 SLA。自托管时应固定版本、保留 3 秒请求间隔、防范不可信论文内容,并逐条核对引用和全文许可。