快速结论
cua 适合需要让智能体操作完整桌面、批量运行 computer-use 评测,或在 Linux、Windows、macOS 和 Android 环境生成轨迹数据的研发团队。它不是单一桌面助手,而是一组基础设施:Cua Driver 让智能体后台点击和输入,Sandbox SDK 统一创建本地或云端环境,Cua Bench 负责评测与轨迹,Lume 管理 Apple Silicon 上的 macOS/Linux 虚拟机,Cua Fleets 面向并行训练、评测和数据生成。
截至 2026-07-21,官方仓库当天仍有提交,7 月 15 日还发布了 @trycua/fleet 维护版本,项目处于活跃开发。核心仓库采用 MIT 许可,但可选组件可能有独立许可:官方特别列出 OmniParser 为 CC-BY-4.0,可选 cua-agent[omni] 包含 AGPL-3.0 的 ultralytics,商业分发前必须逐项复核依赖。官网已将产品重心表述为跨 OS fleet、Driver、Sandbox 和 Bench;托管、BYOC、on-prem 均可咨询,但没有公开逐小时云机价格,因此不能把“注册 API Key”写成免费云算力承诺。
核心功能
- Cua Driver:通过同一 CLI 和 MCP stdio 接口控制 macOS、Windows 与 Linux 原生应用,后台输入尽量不抢占用户鼠标和焦点。
- Sandbox SDK:Python SDK 用统一 API 启动 Linux 容器/VM、macOS、Windows 和 Android,执行 Shell、截图、鼠标、键盘与触控操作。
- 本地与云端后端:本地可使用 Docker、QEMU 或 Apple Virtualization Framework;Cua Cloud 提供跨 OS 托管环境。
- Cua Fleets:从预热池按需领取环境,适合并行 rollout、评测、RL 和数据生成,并支持快照复现失败。
- Cua Bench:支持 OSWorld、ScreenSpot、Windows Arena 与自定义任务,可导出轨迹用于评估或训练。
- Lume:在 Apple Silicon 上创建 macOS/Linux VM,强调接近原生性能,但受主机平台和 Apple 授权边界约束。
- 环境复现:使用镜像、快照和固定任务定义重放失败,比直接在员工桌面上调试更可控。
适合人群
- 训练或评估 computer-use 模型,需要跨操作系统并行环境的 AI 基础设施团队。
- 让 Claude Code、Cursor、Codex 等智能体操作原生桌面应用的开发者。
- 需要自动化传统软件、浏览器加桌面混合流程或移动端操作的测试团队。
- 不适合只需普通网页自动化、缺少虚拟化运维能力,或无法为 GUI 操作建立审批和审计机制的组织。
使用场景
典型场景包括在多台隔离 Windows VM 上测试企业软件、在 macOS 环境重放 Xcode 操作、批量执行 OSWorld 评测、采集带截图和动作的训练轨迹,以及让编码智能体在后台操控测试应用。评测应固定镜像、应用版本、分辨率、语言、随机种子和验收器,否则模型变化与环境漂移会混在一起,分数难以比较。
computer-use 的权限面比浏览器自动化更大。屏幕、剪贴板、文件选择器、系统通知和已登录应用都可能暴露数据;应用或网页内容也可能包含提示注入。生产方案应使用一次性 VM、域名与网络出口白名单、短期凭据、独立测试租户、只读输入和受控输出目录。删除、安装软件、修改系统设置、发送消息、转账、下单和付款必须在执行前请求确认。虚拟机或容器能限制部分影响范围,但不会消除虚拟化逃逸、错误挂载、凭据泄漏或合法权限被滥用的风险。
价格与版本
开源 Driver、Sandbox、Bench 和 Lume 以仓库许可为准,可在自己的基础设施运行;官网明确提供托管 fleet、BYOC 和 on-prem 路径,但截至 2026-07-21 只给出“request access / dedicated fleets by request”,没有公开按 OS、CPU、内存或分钟计费表。云端预算必须向官方询价,并确认镜像存储、快照、网络流量、并发、预热容量、日志和技术支持是否另收费。
| 方案 | 公开价格状态 | 主要成本 |
|---|---|---|
| 本地 Linux 容器 | 开源免费 | 主机、存储、模型与维护 |
| 本地 QEMU/Apple VZ | 开源免费 | VM 镜像、磁盘、内存与宿主机 |
| Cua Cloud | 未公开,需申请 | VM 时长、并发、快照、网络与支持 |
| BYOC / on-prem | 询价 | 自有云资源、部署与企业支持 |
| 评测与数据生成 | 依规模而定 | 模型 token、环境时长、标注与验证 |
成本控制应同时限制最大并发、单 episode 时长、机器规格、快照保留和每日预算。失败重试需要从干净快照启动,并为外部写操作使用幂等键,避免重复提交和重复付款。
国内访问与使用体验
needsVPN: true 反映官网和托管服务在中国大陆的访问与账号可用性可能受网络影响,不代表推荐任何网络服务。开源代码可自行部署,但云端区域、数据跨境、Windows/macOS 许可、模型 API 和支持时区需要在采购前确认。SDK 要求 Python 3.11+;不同后端还需要 Docker、QEMU 或 Apple Silicon。
Driver 的后台输入能力要按操作系统分别验收。Linux 官方说明 X11 与各 Wayland compositor 的原始后台输入存在明确限制,不能假设三大桌面系统行为完全一致。macOS 镜像和无人值守安装也可能受系统版本与首次启动流程影响,升级 OS 后应重新跑基线。
优点
- 一套 API 覆盖容器、桌面 VM 和 Android,适合跨 OS computer-use 研发。
- Driver、Sandbox、Fleet、Bench 和 Lume 从操作到评测形成较完整工具链。
- 可用快照和预热池提升并发评测与失败复现效率。
- 核心 MIT 许可清晰,仓库和文档在评测日仍持续更新。
- MCP、CLI 和 SDK 便于接入不同编码智能体与模型循环。
不足
- Cua Cloud 没有公开单价,团队难以在不询价的情况下精确比较托管成本。
- 跨 OS 并不代表功能完全一致,Wayland、macOS 安装和移动端都有平台差异。
- GUI 操作比 API 集成脆弱,窗口布局、分辨率、弹窗和应用升级都可能影响结果。
- 可选视觉依赖存在不同许可,不能仅凭仓库 MIT 标识判断整个部署的义务。
- 虚拟环境不等于绝对安全,仍需网络、凭据、审批、录像与操作审计。
替代品对比
| 工具 | 更适合的场景 | 环境范围 | 主要取舍 |
|---|---|---|---|
| Browser Use | 托管或开源网页智能体 | 浏览器 | 不覆盖完整桌面 OS |
| Browser Harness | 编码智能体直连 Chrome | 浏览器/CDP | 更轻,但不提供跨 OS fleet |
| E2B | 代码智能体云沙箱 | Linux 沙箱 | 桌面与移动覆盖较少 |
| Daytona | 可复现开发环境 | 开发工作区 | 更偏代码环境而非 GUI benchmark |
| Claude Code | 终端仓库任务 | 本地终端与工具 | 不是虚拟桌面基础设施 |
| DeerFlow | 研究、编码和长任务 | Agent harness 加沙箱 | 不专注跨 OS computer-use 评测 |
常见问题 FAQ
cua 是一个桌面智能体吗?
更准确地说,它是 computer-use 基础设施集合。团队可以用 Driver、Sandbox 和 Agent SDK 构建智能体,也可以用 Bench 与 Fleets 做评测和训练数据生成。
Cua Cloud 有免费额度或公开单价吗?
截至 2026-07-21,官网没有公开云 VM 单价,只提供申请访问和专用 fleet 咨询。预算时应直接询价,不要假设 API Key 等于免费算力。
整个项目都只有 MIT 许可吗?
核心仓库标注 MIT,但第三方和可选组件有自己的许可。官方列出的 OmniParser 为 CC-BY-4.0,可选 ultralytics 依赖为 AGPL-3.0,需要单独审查。
VM 能否彻底隔离危险操作?
不能。VM 降低宿主机暴露,但错误挂载、共享剪贴板、网络出口、临时凭据和虚拟化漏洞仍是风险,需要最小权限与人工审批共同控制。
如何防止 GUI 智能体重复付款或提交?
在最终按钮前设置强制确认,使用测试账号和金额上限,给业务请求加幂等键,并在重试前从后端核对交易状态,而不是只看界面。
cua 适合网页自动化吗?
可以,但若任务完全在浏览器内,Browser Use 或 Browser Harness 通常更轻。cua 的优势在完整桌面和跨 OS 环境。
总结
cua 的核心价值是把 computer-use 从单机演示扩展到可复现的跨 OS 环境、评测和 fleet。对模型研发、桌面软件测试和轨迹生成团队,它比单一浏览器框架更完整;对普通网页流程则可能过重。建议先用固定镜像跑小规模基准,测量成功率、人工接管、单 episode 成本和失败可复现性,再决定是否采购云 fleet。无论本地还是云端,都必须落实域名白名单、凭据隔离、幂等重试、预算上限和高风险动作确认。