ArXiv MCP Server by blazickjp logo

ArXiv MCP Server by blazickjp

★★★★ 4.3/5
访问官网
分类
MCP
定价
免费
访问
直连可用

快速结论

ArXiv MCP Server by blazickjp 适合希望在 Claude、Codex、VS Code 等 MCP 客户端中完成“搜索论文、下载、分段阅读、比较和综述草稿”的研究者与开发者。0.5.1 版本要求 Python 3.11+,采用 Apache-2.0 许可证,基础工具覆盖 search_papersdownload_paperlist_papersread_paper,支持本地存储、HTML 优先/PDF 回退、长论文分页、stdio 和 Streamable HTTP。

它是检索与内容接入层,不是同行评审数据库、事实核查器或自动引用权威。arXiv 包含预印本,论文可能未经评审、已过时、结论错误,甚至故意嵌入提示注入文字。项目已经明确把论文内容标为不可信外部输入。若同一个 Agent 还拥有 Shell、文件写入、浏览器或敏感数据库权限,风险会被放大;研究流程应只读、隔离,并由人核对原文、版本和引用。

核心功能

  • 论文搜索:按查询、日期、分类、相关性或时间排序,项目自动执行 arXiv 的三秒请求间隔。
  • 下载与缓存:按 arXiv ID 下载,优先处理 HTML,老论文可安装 [pdf] 额外依赖回退 PDF。
  • 分段阅读startmax_charsnext_start 和截断标记避免长论文被客户端输出上限静默裁切。
  • 本地论文管理list_papers 查看已下载 ID,read_paper 读取本地 Markdown 内容。
  • 研究 prompts:基础深度分析 prompt,以及摘要、比较、文献综述等提示模板。
  • 实验 Pro 功能:可选 sentence-transformers 支持本地语义搜索,并提供引文图与研究提醒;官方标注尚未完全测试。
  • 模型无关 MCP:兼容多种 MCP 宿主,但模型上下文长度、引用能力与抗注入能力决定实际效果。

适合人群

  • 研究人员和学生:高频查找 arXiv 预印本,并希望保留本地论文缓存。
  • 技术情报团队:按主题与分类做受控检索,再由专家筛选。
  • MCP 开发者:需要一个读多写少、工具边界清晰的研究服务器。
  • 文献综述作者:先建立候选集、分页读取和比较表,再回到原文引用。
  • 不适合的人群:需要 Web of Science 等正式索引、版权全文库、自动事实认证,或想让高权限 Agent 无人监督地执行论文指令的人。

使用场景

  • 主题扫描:限制日期、分类和数量,生成候选论文清单,不把搜索摘要当完整证据。
  • 单篇精读:下载后按页段读取,分别提取方法、数据、结果、局限和待验证问题。
  • 多论文比较:用 prompt 建立结构化对照,再人工核对版本、实验设置和表格数字。
  • 本地语义检索:对已下载集合启用实验依赖,寻找主题相近文本,而非搜索整个 arXiv。
  • 研究提醒:实验性 watch 记录主题并轮询新论文,严格控制频率与误报。

价格与版本

基础包免费,Apache-2.0 允许在保留许可与通知条件下使用和修改代码。论文内容的版权与许可由每篇 arXiv 投稿分别决定;服务器许可证不授予重发所有 PDF、图表或数据集的权利。0.5.1 基础依赖负责搜索、HTML 内容和 MCP;[pdf] 增加 PDF 解析,[pro] 增加本地向量模型依赖。官方特别提醒 npm 上同名包不是该项目,支持的手动安装入口是 PyPI 的 uv tool install arxiv-mcp-server

没有订阅费和官方托管 SLA。成本来自主机、磁盘、嵌入模型、MCP 宿主模型和网络。arXiv 搜索受三秒间隔约束,触发限流后项目建议等待 60 秒;MAX_RESULTS 默认 50,REQUEST_TIMEOUT 默认 60 秒。不要通过并发实例绕过上游政策。

国内访问与使用体验

安装需要访问 GitHub 或 PyPI,检索和下载依赖 arXiv,实验引文图还会访问 Semantic Scholar。地区网络和源站状态会影响速度。基础 arXiv 查询通常不需要 API Key;本地 stdio 也不要求该项目账号。HTTP 默认绑定 127.0.0.1,启用 DNS rebinding 防护并允许配置 Host/Origin,但这不是完整用户鉴权。跨机器暴露前必须增加 TLS、认证、反向代理、来源限制和请求配额。

论文先保存到本地目录,团队应定义存储保留、磁盘配额和敏感研究数据政策。模型可能遗漏公式、误读 PDF 排版、编造引文或把论文中的恶意指令当系统任务。将服务器置于只读工具组,不让论文内容直接驱动 Shell、文件删除、邮件或凭据访问;任何“按论文要求执行命令”的输出都应拦截。

优点

  • 搜索、下载、缓存、分页阅读形成完整基础研究链路。
  • 三秒节流和明确的截断元数据减少误用与静默丢文。
  • stdio、HTTP、.mcpb、VS Code 和 Codex 配置覆盖多种入口。
  • Apache-2.0 代码许可清晰,Python 包与版本信息可核验。
  • 官方文档直接说明提示注入和 HTTP 暴露风险,安全边界比许多研究 MCP 更透明。

不足

  • arXiv 预印本不等于同行评审结论,工具也不做事实核查。
  • 复杂 PDF、公式、图表和多栏版式仍可能提取失败或顺序错误。
  • HTTP 没有开箱即用的用户认证,远程部署需额外工程。
  • 三秒限流不适合无节制批量抓取,实验功能稳定性也未获完整承诺。
  • 语义搜索模型会增加下载、内存和许可核查,且只覆盖本地集合。

替代品对比

工具更适合谁优势局限
ArXiv Scout需要引用探索、PDF 提取和研究提示词的人Semantic Scholar 引用查询、PDF 提取与研究 prompts社区和基础工作流不同
cyanheads OpenAlex MCP Server需要跨作者、机构、主题元数据的人学术图谱覆盖更广不以 arXiv 全文缓存为核心
cyanheads PubMed MCP Server生物医学研究者PubMed、Europe PMC、MeSH 与引文格式学科范围更窄
Paper Search需要多源论文发现的人不局限于单一仓库本地 arXiv 阅读链路较弱
Paper Search希望组合搜索与模型工作流的人多工具研究入口部署和数据边界需另查

常见问题 FAQ

ArXiv MCP Server 免费吗?

是,代码采用 Apache-2.0。模型调用、主机和某些外部服务仍可能产生费用。

需要 arXiv API Key 吗?

基础搜索与下载通常不需要 Key。HTTP 多用户部署仍必须自行增加身份认证。

为什么搜索不能高并发?

项目自动遵守 arXiv 三秒请求间隔;限流后应等待并退避,而不是用更多进程规避规则。

可以相信 AI 生成的论文摘要吗?

不能直接相信。核对原文、版本、实验设置、数字和引用,尤其注意预印本尚未同行评审。

不可信论文会攻击 Agent 吗?

可能。论文文字可包含提示注入。保持只读、隔离其他高权限工具,并把文本当数据而非指令。

它支持哪些模型?

服务器不绑定模型;任何兼容 MCP 的宿主都可调用,但长上下文、PDF 理解和抗注入表现因模型而异。

总结

ArXiv MCP Server by blazickjp 是目前较完整的 arXiv 研究 MCP 之一,尤其适合本地缓存、长文分页和受控文献分析。真正可靠的部署需要同时尊重三条边界:Apache 代码许可不等于论文内容许可,MCP 取到文本不等于结论可信,HTTP 可运行不等于已完成鉴权。锁定版本、遵守限流、限制工具权限、隔离不可信论文并人工核对引用,才能把便利转化为可信研究流程。

最后更新:2026年7月21日

同类工具推荐