快速结论
ArXiv MCP Server by blazickjp 适合希望在 Claude、Codex、VS Code 等 MCP 客户端中完成“搜索论文、下载、分段阅读、比较和综述草稿”的研究者与开发者。0.5.1 版本要求 Python 3.11+,采用 Apache-2.0 许可证,基础工具覆盖 search_papers、download_paper、list_papers 与 read_paper,支持本地存储、HTML 优先/PDF 回退、长论文分页、stdio 和 Streamable HTTP。
它是检索与内容接入层,不是同行评审数据库、事实核查器或自动引用权威。arXiv 包含预印本,论文可能未经评审、已过时、结论错误,甚至故意嵌入提示注入文字。项目已经明确把论文内容标为不可信外部输入。若同一个 Agent 还拥有 Shell、文件写入、浏览器或敏感数据库权限,风险会被放大;研究流程应只读、隔离,并由人核对原文、版本和引用。
核心功能
- 论文搜索:按查询、日期、分类、相关性或时间排序,项目自动执行 arXiv 的三秒请求间隔。
- 下载与缓存:按 arXiv ID 下载,优先处理 HTML,老论文可安装
[pdf]额外依赖回退 PDF。 - 分段阅读:
start、max_chars、next_start和截断标记避免长论文被客户端输出上限静默裁切。 - 本地论文管理:
list_papers查看已下载 ID,read_paper读取本地 Markdown 内容。 - 研究 prompts:基础深度分析 prompt,以及摘要、比较、文献综述等提示模板。
- 实验 Pro 功能:可选
sentence-transformers支持本地语义搜索,并提供引文图与研究提醒;官方标注尚未完全测试。 - 模型无关 MCP:兼容多种 MCP 宿主,但模型上下文长度、引用能力与抗注入能力决定实际效果。
适合人群
- 研究人员和学生:高频查找 arXiv 预印本,并希望保留本地论文缓存。
- 技术情报团队:按主题与分类做受控检索,再由专家筛选。
- MCP 开发者:需要一个读多写少、工具边界清晰的研究服务器。
- 文献综述作者:先建立候选集、分页读取和比较表,再回到原文引用。
- 不适合的人群:需要 Web of Science 等正式索引、版权全文库、自动事实认证,或想让高权限 Agent 无人监督地执行论文指令的人。
使用场景
- 主题扫描:限制日期、分类和数量,生成候选论文清单,不把搜索摘要当完整证据。
- 单篇精读:下载后按页段读取,分别提取方法、数据、结果、局限和待验证问题。
- 多论文比较:用 prompt 建立结构化对照,再人工核对版本、实验设置和表格数字。
- 本地语义检索:对已下载集合启用实验依赖,寻找主题相近文本,而非搜索整个 arXiv。
- 研究提醒:实验性 watch 记录主题并轮询新论文,严格控制频率与误报。
价格与版本
基础包免费,Apache-2.0 允许在保留许可与通知条件下使用和修改代码。论文内容的版权与许可由每篇 arXiv 投稿分别决定;服务器许可证不授予重发所有 PDF、图表或数据集的权利。0.5.1 基础依赖负责搜索、HTML 内容和 MCP;[pdf] 增加 PDF 解析,[pro] 增加本地向量模型依赖。官方特别提醒 npm 上同名包不是该项目,支持的手动安装入口是 PyPI 的 uv tool install arxiv-mcp-server。
没有订阅费和官方托管 SLA。成本来自主机、磁盘、嵌入模型、MCP 宿主模型和网络。arXiv 搜索受三秒间隔约束,触发限流后项目建议等待 60 秒;MAX_RESULTS 默认 50,REQUEST_TIMEOUT 默认 60 秒。不要通过并发实例绕过上游政策。
国内访问与使用体验
安装需要访问 GitHub 或 PyPI,检索和下载依赖 arXiv,实验引文图还会访问 Semantic Scholar。地区网络和源站状态会影响速度。基础 arXiv 查询通常不需要 API Key;本地 stdio 也不要求该项目账号。HTTP 默认绑定 127.0.0.1,启用 DNS rebinding 防护并允许配置 Host/Origin,但这不是完整用户鉴权。跨机器暴露前必须增加 TLS、认证、反向代理、来源限制和请求配额。
论文先保存到本地目录,团队应定义存储保留、磁盘配额和敏感研究数据政策。模型可能遗漏公式、误读 PDF 排版、编造引文或把论文中的恶意指令当系统任务。将服务器置于只读工具组,不让论文内容直接驱动 Shell、文件删除、邮件或凭据访问;任何“按论文要求执行命令”的输出都应拦截。
优点
- 搜索、下载、缓存、分页阅读形成完整基础研究链路。
- 三秒节流和明确的截断元数据减少误用与静默丢文。
- stdio、HTTP、
.mcpb、VS Code 和 Codex 配置覆盖多种入口。 - Apache-2.0 代码许可清晰,Python 包与版本信息可核验。
- 官方文档直接说明提示注入和 HTTP 暴露风险,安全边界比许多研究 MCP 更透明。
不足
- arXiv 预印本不等于同行评审结论,工具也不做事实核查。
- 复杂 PDF、公式、图表和多栏版式仍可能提取失败或顺序错误。
- HTTP 没有开箱即用的用户认证,远程部署需额外工程。
- 三秒限流不适合无节制批量抓取,实验功能稳定性也未获完整承诺。
- 语义搜索模型会增加下载、内存和许可核查,且只覆盖本地集合。
替代品对比
| 工具 | 更适合谁 | 优势 | 局限 |
|---|---|---|---|
| ArXiv Scout | 需要引用探索、PDF 提取和研究提示词的人 | Semantic Scholar 引用查询、PDF 提取与研究 prompts | 社区和基础工作流不同 |
| cyanheads OpenAlex MCP Server | 需要跨作者、机构、主题元数据的人 | 学术图谱覆盖更广 | 不以 arXiv 全文缓存为核心 |
| cyanheads PubMed MCP Server | 生物医学研究者 | PubMed、Europe PMC、MeSH 与引文格式 | 学科范围更窄 |
| Paper Search | 需要多源论文发现的人 | 不局限于单一仓库 | 本地 arXiv 阅读链路较弱 |
| Paper Search | 希望组合搜索与模型工作流的人 | 多工具研究入口 | 部署和数据边界需另查 |
常见问题 FAQ
ArXiv MCP Server 免费吗?
是,代码采用 Apache-2.0。模型调用、主机和某些外部服务仍可能产生费用。
需要 arXiv API Key 吗?
基础搜索与下载通常不需要 Key。HTTP 多用户部署仍必须自行增加身份认证。
为什么搜索不能高并发?
项目自动遵守 arXiv 三秒请求间隔;限流后应等待并退避,而不是用更多进程规避规则。
可以相信 AI 生成的论文摘要吗?
不能直接相信。核对原文、版本、实验设置、数字和引用,尤其注意预印本尚未同行评审。
不可信论文会攻击 Agent 吗?
可能。论文文字可包含提示注入。保持只读、隔离其他高权限工具,并把文本当数据而非指令。
它支持哪些模型?
服务器不绑定模型;任何兼容 MCP 的宿主都可调用,但长上下文、PDF 理解和抗注入表现因模型而异。
总结
ArXiv MCP Server by blazickjp 是目前较完整的 arXiv 研究 MCP 之一,尤其适合本地缓存、长文分页和受控文献分析。真正可靠的部署需要同时尊重三条边界:Apache 代码许可不等于论文内容许可,MCP 取到文本不等于结论可信,HTTP 可运行不等于已完成鉴权。锁定版本、遵守限流、限制工具权限、隔离不可信论文并人工核对引用,才能把便利转化为可信研究流程。