快速结论
Caveman 不是一个单一终端程序,而是围绕“减少 Agent 冗余 token”形成的本地开源技能与工具家族。最基础的 Caveman skill 通过提示规则让 Claude Code、Codex、Cursor、Windsurf、Cline、Copilot 等 Agent 输出更短;Caveman Code 则是另一套独立安装的完整终端编码 Agent,带工具输出压缩、只读计划、自主目标循环、子 Agent、模型选择和会话能力。Cavemem、Cavekit、浏览器扩展与 SDK 也是独立组件。官网还展示 Caveman Gateway 与 Cloud,但托管引擎和控制面仍处于开发或等待名单阶段,不能与已可本地安装的 MIT 工具混为一谈。
最值得注意的是基准范围。Caveman skill 公布的“平均减少 65%”只针对 10 个提示下的模型输出 token,不压缩输入、上下文、文件或推理 token;规则本身每轮还增加约 1,000 至 1,500 个输入 token,短回答可能净亏。Caveman Code 的“约 2 倍”来自另一项 25 任务 MicroBench:同为 gpt-5.5、xhigh reasoning 时,Caveman 使用 524k fresh tokens、通过 14/25,Codex 使用 1,010k、通过 15/25,即约 1.93 倍更少 fresh tokens且少通过一题。这是特定日期、任务集、模型和记账口径,不是所有仓库的性能保证。本站因此不默认推荐,建议用户对自己的提供商账单做同任务 A/B。
核心功能
- Caveman skill:用
lite、full、ultra、wenyan等强度减少解释中的套话,同时要求保留代码、命令、路径和错误文本。 - Caveman Code:独立终端编码 Agent,可交互运行、单次打印、执行工具、管理会话并接入多种模型提供商。
- 工具输出控制:Caveman Code 对 read、grep、bash 等工具设置预算,折叠空行、去除 ANSI 并避免重复读取文件。
- 计划与执行分离:计划模式只开放读取类工具,形成方案后再由
/act进入修改阶段。 - 自主目标循环:以迭代、费用、无进展和中断等条件限制长任务,并保存检查点与账本。
- 子 Agent 与模型分工:可在隔离 worktree 中并行运行子 Agent,并让规划模型与编辑模型分工。
- Cavemem 与生态组件:本地记忆、spec 驱动开发、浏览器模式、SDK 与 MCP 属于可分别安装和审查的组件。
- 多提供商接入:Caveman Code 支持 API Key、自定义兼容端点及多种 OAuth 登录;账号政策和费用由每个上游决定。
适合人群
- 经常收到长篇解释,希望提高阅读速度,并愿意检查 token A/B 的 Agent 用户。
- 需要可检查的 MIT 终端 Agent、计划模式、子 Agent 和本地会话能力的开发者。
- 使用按 token 计费 API,且工作负载包含长回复或大量工具输出的个人与团队。
- 想研究提示层、工具输出层和记忆层压缩效果的 Agent 工程师。
- 不适合按请求收费、原本回答已很短、不能审查安装脚本,或要求成熟企业 Cloud SLA 的用户。
使用场景
只想压短现有 Agent 回复时,应先安装 skill,不要因为同一品牌就误装完整 Caveman Code。挑选五到十个日常任务,记录上游账单中的输入、缓存、输出、推理 token、请求数、成功率和耗时,再分别运行开启与关闭版本。若只看输出 token,会忽略规则注入、重试、工具调用和上下文缓存;若使用 GitHub Copilot 一类按请求或高级请求计费的服务,回答更短也未必减少费用。
需要完整终端 Agent 时,再评估 Caveman Code。它会读取仓库、运行命令、修改文件,并可能通过模型提供商发送代码上下文,因此应先在测试仓库和非生产账号中使用,限制工具权限,检查 diff 与命令,并保留正常分支、测试和 review。自主循环、子 Agent 与自动执行会放大错误和费用,必须设置迭代、成本、目录和网络边界。可以同时比较 Claude Code、Codex、OpenCode 与 Gemini CLI。
价格与版本
Caveman skill、Caveman Code 及多个本地组件采用 MIT 许可证,可免费安装和修改。目录使用“免费增值”,是因为品牌同时存在仍在开发的托管 Gateway、Engine 或 Cloud 路径;等待名单不是已经可采购的稳定套餐,官网演示也不能当作当前 SLA、区域、额度或数据承诺。云端正式开放前,应以届时的控制台、合同、隐私政策和数据处理条款为准。
实际成本来自模型 API、订阅、工具运行、存储、机器和人的审核。Caveman Code 的 OAuth 登录可能复用用户已有订阅,但“可以登录”不等于提供商明确允许所有第三方客户端用途;使用前要核对上游条款、额度与封号风险。基准里的 token 降幅也不能直接换算为固定金额,因为输入、缓存、推理、输出和请求可能采用不同单价。
国内访问与使用体验
本地工具能否运行取决于 Node.js、Git、终端、操作系统、安装源和模型提供商。npm 包、GitHub 仓库或官网可用,不代表所选海外模型账号和 OAuth 登录在中国大陆同样稳定。本文只说明访问差异,不提供网络线路建议。优先使用官方 npm 包或仓库发布说明,固定版本,并先执行 dry run 或阅读安装脚本。
官网提供 curl ... | bash 和 PowerShell 一键脚本,这类命令会把远程最新内容直接交给 shell,便利但信任面大。高安全环境应先下载、阅读并固定 commit 或 release,再执行;检查脚本将写入哪些 Agent 目录、是否修改设置和 hooks,以及如何卸载。Caveman Code 还会接触 API Key、OAuth token、代码、命令输出和会话;即使程序本地运行,上游模型仍可能接收这些内容。
优点
- 清楚区分轻量 skill 与完整终端 Agent,可按需求选择最小组件。
- MIT 开源,提示、脚本、Agent 运行时和基准材料可检查。
- 官方基准公开任务、口径和限制,而不是只保留“65%”营销数字。
- Caveman Code 同时控制回复、工具输出与重复读取,比只改语气覆盖更多 token 来源。
- 支持计划模式、检查点、子 Agent、MCP、Skills 和多提供商。
- Caveman 官方诚实说明短回答、按请求计费和部分 Agent 中可能净亏。
不足
- Caveman skill 每轮增加输入规则,原本简短的任务可能花费更多 token。
- 65% 是输出降幅,1.93 倍是特定 MicroBench fresh-token结果,两者不能混用。
- Caveman Code 与 skill 是不同产品,官网总品牌容易让用户误解功能归属。
- 远程一键安装、hooks、工具权限和 OAuth 扩大了本地供应链与凭据风险。
- 本地运行不等于代码不发送给模型提供商,数据边界取决于所选上游。
- Cloud 仍在开发或等待名单,企业能力、价格、地区和 SLA 尚不能按成熟产品采购。
替代品对比
| 工具 | 更适合谁 | 主要优势 | 需要注意 |
|---|---|---|---|
| Claude Code | 重视成熟终端编码体验的用户 | 官方 Agent 工作流与 Anthropic 集成 | 闭源服务,计费与数据条款独立 |
| Codex | OpenAI 生态与任务执行用户 | 编码 Agent 和云端协同完整 | Caveman 基准只是一个特定对照,不代表全面胜负 |
| OpenCode | 需要开源客户端和多提供商的人 | 开放、可扩展、模型选择灵活 | 默认不提供 Caveman 的同套压缩策略 |
| Gemini CLI | Google 开发生态与开源终端客户端用户 | 官方 Gemini 接入和工具能力 | 账号、配额和数据处理由 Google 决定 |
| Aider | 偏好 git 工作流与多模型代码编辑的人 | 成熟 repo map 和编辑格式 | 交互、自动循环和压缩设计不同 |
常见问题 FAQ
Caveman 和 Caveman Code 是同一个程序吗?
不是。Caveman 是可安装到多种 Agent 的简洁输出 skill;Caveman Code 是独立终端编码 Agent。它们共享品牌与节省 token 的理念,但安装、功能和数据边界不同。
“减少 65% token”具体指什么?
指 Caveman skill 在 10 个提示基准中平均减少 65% 输出 token。它不包括输入、上下文、文件和推理 token,而且 skill 规则本身每轮增加约 1,000 至 1,500 个输入 token。
“比 Codex 少约一半 token”是否适用于所有任务?
不适用。该结论来自 25 个特定任务、同一模型和 reasoning 设置的 MicroBench,Caveman 通过 14 项、Codex 通过 15 项。应在自己的仓库和账单中复现。
Caveman 是完全免费的吗?
本地 MIT 工具免费,但模型 API、订阅、机器和审核仍有成本。托管 Cloud 仍在开发,未来价格与条款不能从开源许可证推断。
本地运行会把代码发给第三方吗?
可能。skill 由宿主 Agent 处理,Caveman Code 也会调用用户选择的模型提供商。除非明确使用本地模型并验证网络行为,否则应假定相关提示与代码上下文可能发往上游。
可以直接运行官网的一键安装脚本吗?
个人测试可以自行评估,但高信任环境应先下载、审查并固定版本。远程脚本可能修改多个 Agent 的技能、设置或 hooks,执行前要确认路径、权限和卸载方式。
总结
Caveman 的可取之处不是一句“少 65%”,而是把简洁输出、工具预算、重复读取控制、计划、记忆和完整终端 Agent 拆成可检查组件,并公开承认不适用场景。正确评估必须先区分 skill、Caveman Code、其他本地工具和仍在开发的 Cloud,再按上游账单做同任务 A/B。长回复和大工具输出可能明显受益;短问答、按请求收费或规则反复注入的环境可能更贵。任何采用都应从最小组件、固定版本、测试仓库和最小权限开始。