Cua 详解:给 AI Agent 一台能用的电脑
Computer-Use Agent(CUA)的瓶颈往往不在模型,在机器:Agent 要操作真实桌面,就得有隔离的虚拟机、不抢鼠标的后台驱动、可复现的评测环境——这些基建各自都是脏活。trycua/cua(Cua,Computer-Use Agent 的缩写)把这层基建整体开源:Lume 管 Apple Silicon 上的 macOS/Linux 虚拟机、Cua Driver 做三平台后台桌面自动化、Cua Fleets 弹性调度跨 OS 机群、CUA-S1 提供专用小模型、Cua Bench 负责任务评测与训练数据导出。约 25.2k Star、MIT 协议,商业云按量计费(SOC 2 Type I)。官方口号直白:Give AI agents computers they can use。本文从五大组件、架构分层、使用路径到选型,完整拆解。
1、项目概述
Cua 定位为 computer-use 2.0 的规模化基建:开源驱动、跨 OS 机群与面向训练评测数据生成的基准,官方对 computer-use 2.0 的定义是"同一任务里 Agent 在代码、API 与图形界面之间切换"。由 Cua AI 公司(trycua 组织)维护,2025 年 1 月创建,约 25.2k Star、1.7k Fork、MIT 协议(OmniParser 组件 CC-BY-4.0、可选 omni 依赖 AGPL-3.0 需留意)。产品分层清晰:开源层(Driver / Lume / Bench,MIT)+ 商业层(Cua Cloud 与 Fleets,按量计费,SOC 2 Type I、BYOC 与 on-prem 可选)。生态位显赫:Hermes、Clicky、H Company、Factory Droid 等 Agent 产品都由 Cua Driver 驱动,OpenAI 与 Qwen Code 有集成。
基本盘:
- 四 OS 家族:Linux(Ubuntu 容器或全 VM)、Windows(11 与 Server 2025)、macOS(Sequoia / Tahoe,Apple Silicon 专利虚拟化栈)、Android(VM + 触摸自动化)
- 本地运行时:Docker、QEMU、Apple VZ 三后端;云上走 Cua Cloud 的预热机器池
- 定价:CPU $0.044625/vCPU/小时、内存 $0.0223125/GB/小时,按量计费
- 合规:SOC 2 Type I、BYOC、on-prem 可选
- 活跃度:1028 个 open issue、近 24 小时内有推送——迭代极快
2、五大组件:从驱动到基准
仓库是 monorepo,五大组件各管一段,拼成完整 CUA 栈。
组件矩阵:
- Cua Driver:后台桌面自动化驱动——向指定窗口发点击与按键而不动系统光标、不抢焦点;可查无障碍树、捕获窗口状态;同一二进制跑成 MCP stdio 服务器、常驻守护或一次性 shell 命令,覆盖 macOS / Windows / Linux
- Cua Sandbox / Fleets:沙箱运行时与弹性机群——本地 Docker / QEMU / Apple VZ 起一次性 GUI 环境;云端从形式化验证的预热池毫秒级领用机器,闲时缩到零
- Lume:Apple Silicon 上的 macOS / Linux 虚拟机管理,基于 Apple Virtualization.Framework,Swift 编写
- CUA-S1:专用 System 1 小模型家族——快速有界决策(如表单字段该填什么值),首个研究档案聚焦 forms;源码 MIT,权重与数据集在 Hugging Face
- Cua Bench:任务构建、Agent 评测与轨迹导出——evaluator 判定目标是否完成,轨迹可导出为训练数据;模拟任务零依赖起步(无需 VM、Docker、模型 Key)
组件要点:
1. Driver 的后台模式是关键差异:传统桌面自动化抢鼠标毁体验,Driver 把操作投递到目标窗口——README 演示了两个 Driver 会话同时操作 LibreOffice 与 Inkscape 而终端保持前台
2. 一个驱动面管四 OS:MCP + CLI 统一接口,Agent 与人类用同一套 harness
3. CUA-S1 的定位克制:官方明言 System 1 只是工程类比——快而有界的决策,不替代通用 Agent 的规划推理
4. Bench 的数据生意:环境跑 rollout + evaluator 验证 + 人工审核金轨迹,按目标模型与难度分层交付"已验证轨迹数据集"
3、两条使用路径:驱动与机群
最常见的两种起步:给 Agent 装手(Driver),或给 Agent 租机器(Fleets)。
# 路径一:Cua Driver —— 本机后台驱动桌面应用
# macOS / Linux 安装
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"
# Windows (PowerShell)
# irm https://cua.ai/driver.ps1 | iex
# 首个任务:连接 Agent,让它在计算器里算 6 × 7
# 并验证应用显示 42(官方教程)
# 接入方式:CLI / MCP stdio server / 类型化 SDK
# Claude Code / Codex / Cursor / OpenClaw 均有集成指南
# 路径二:Cua Fleets —— 云端机群领用桌面
# run.cua.ai 注册后,Python SDK 领用机器:
# from cua import Sandbox
# sbx = Sandbox() # 从预热池领一台 Linux 桌面
# r = sbx.run("uname -a") # 执行命令
# sbx.screenshot() # 截图
# sbx.delete() # 释放(注意清理,池会保留计费容量)
# 路径三:Lume —— 本地 macOS VM(Apple Silicon)
/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
# lume create --macos tahoe && lume start ... 后 SSH 连接
# 路径四:Cua Bench —— 零依赖评测起步
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium
# 创建任务 → 跑参考解 → evaluator 报 reward 1.0 即通过路径要点:
1. Driver 接入 Agent 的姿势:跑成 MCP 服务器挂给 Claude Code 等,或 CLI 直控——人与 Agent 共用一套面
2. Fleets 的预热池经济学:毫秒级领用换来"池在闲时也计费"——官方教程专门强调 cleanup 步骤
3. 本地与云共用 Sandbox SDK,但凭据、镜像与运行时要求不同——按 runtime support 参考选环境
4. Bench 起步零依赖:Python 3.12/3.13 + uv 即可,浏览器任务装 Playwright Chromium
4、训练与数据:机群的第二种用法
同一套机群,既能给训练循环供环境,也能直接产出验证过的数据。
两种消费模式:
- 对着活环境训练:训练 / 评测循环指向预热机群池——按需领环境、走任务、收奖励、还回去,池为大批量并行设计
- 直接拿验证数据:跳过 harness——官方在同一环境跑 rollout,交付经验证的轨迹数据集,按任务与界面划分,打包进你的数据管线
数据验证四层:
- evaluator 在环:任务内置检查器判定 rollout 是否完成目标
- 人工审核金轨迹:精选范围提供人工复核的金轨迹与步骤级标注
- 可设验收线:目标模型、难度分层、界面组合自定义,交付前守线
- 基准透明:Cua-Bench 公开榜显示最强前沿 Agent 在 25 个专家级 KiCad 任务中仅通过 6 个——难度与诚实度兼备
数据要点:
1. "环境即数据工厂"是 Cua 商业模式的独特角度:不止卖算力,卖的是带验证的轨迹
2. KiCad 基准结果(6/25)给行业泼了盆冷水:专业桌面软件上的 CUA 远未 solved
3. 快照与复现:从快照 fork、复现失败——RL 调试的刚需配置
4. CUA-S1 源码在仓库(MIT),权重另存 Hugging Face——许可按模型卡逐个核对
5、定位对比:CUA 基建三选一
把 Cua 与 E2B、Browser Use 放在一张桌上,三种执行环境路线清晰起来。
三者对比:
- Cua:全 OS 桌面机群 + 后台驱动 + 评测基准 + 训练数据,开源核心 + 商业云(25.2k Star,MIT)
- E2B:代码解释器沙箱为主打(安全执行 AI 生成代码),轻量快速,桌面 GUI 与跨 OS 覆盖弱
- Browser Use:浏览器内自动化专精(约 88k Star 的网页 Agent 库),不出浏览器域
选型建议:
1. 要原生桌面应用、跨四 OS、训练评测一体 → Cua
2. 只要安全跑代码片段 → E2B
3. 只做网页操作 → Browser Use
4. 组合玩法:Cua 沙箱做外层环境,内部代码执行调 E2B,网页环节用 Browser Use——按界面类型分工
6、总结
Cua 是 trycua 公司的 computer-use 2.0 基建套件(约 25.2k Star、1.7k Fork、MIT 协议):五大组件各司其职——Driver 以后台模式驱动三平台原生应用(不抢光标、MCP/CLI/SDK 三接入)、Sandbox 与 Fleets 以 Docker / QEMU / Apple VZ 本地后端与云端预热池覆盖 Linux / Windows / macOS / Android 四 OS、Lume 管 Apple Silicon 虚拟机、CUA-S1 供表单决策专用小模型、Bench 做任务评测与轨迹导出;机群既服务训练评测循环,也直接交付验证过的轨迹数据集(evaluator + 人工金轨迹 + 可设验收线);商业云按量计费(CPU $0.045/vCPU/时口径),SOC 2 Type I 合规,Hermes、Factory Droid 等产品与 OpenAI、Qwen Code 生态均有集成。
适用与边界:它适合认真做 CUA 的团队——训练 RL、跑评测、生成数据、驱动真实桌面应用,开源核心 + 商业云的分层让原型到生产一条路走通;1028 个 open issue 与高频推送说明项目迭代极快,API 与组件边界仍在演进,采用时按当前文档校准;Driver 的后台投递依赖"应用与平台支持",边界情形见平台支持文档;KiCad 基准(最强 Agent 仅 6/25)提示专业软件场景远未成熟,预期管理要现实;OmniParser 组件 CC-BY-4.0、可选 ultralytics 依赖 AGPL-3.0,商用集成注意第三方许可组合;Fleets 计费的"池保留容量"特性要求严格走 cleanup 流程,否则闲时也在烧钱。

