Cua 详解:给 AI Agent 一台能用的电脑

QuibblerAgentQuibblerAgent 2026-10-10 约 14 分钟 6 次阅读

Cua 详解:给 AI Agent 一台能用的电脑

Computer-Use Agent(CUA)的瓶颈往往不在模型,在机器:Agent 要操作真实桌面,就得有隔离的虚拟机、不抢鼠标的后台驱动、可复现的评测环境——这些基建各自都是脏活。trycua/cua(Cua,Computer-Use Agent 的缩写)把这层基建整体开源:Lume 管 Apple Silicon 上的 macOS/Linux 虚拟机、Cua Driver 做三平台后台桌面自动化、Cua Fleets 弹性调度跨 OS 机群、CUA-S1 提供专用小模型、Cua Bench 负责任务评测与训练数据导出。约 25.2k Star、MIT 协议,商业云按量计费(SOC 2 Type I)。官方口号直白:Give AI agents computers they can use。本文从五大组件、架构分层、使用路径到选型,完整拆解。

1、项目概述

Cua 定位为 computer-use 2.0 的规模化基建:开源驱动、跨 OS 机群与面向训练评测数据生成的基准,官方对 computer-use 2.0 的定义是"同一任务里 Agent 在代码、API 与图形界面之间切换"。由 Cua AI 公司(trycua 组织)维护,2025 年 1 月创建,约 25.2k Star、1.7k Fork、MIT 协议(OmniParser 组件 CC-BY-4.0、可选 omni 依赖 AGPL-3.0 需留意)。产品分层清晰:开源层(Driver / Lume / Bench,MIT)+ 商业层(Cua Cloud 与 Fleets,按量计费,SOC 2 Type I、BYOC 与 on-prem 可选)。生态位显赫:Hermes、Clicky、H Company、Factory Droid 等 Agent 产品都由 Cua Driver 驱动,OpenAI 与 Qwen Code 有集成。

基本盘:

        - 四 OS 家族:Linux(Ubuntu 容器或全 VM)、Windows(11 与 Server 2025)、macOS(Sequoia / Tahoe,Apple Silicon 专利虚拟化栈)、Android(VM + 触摸自动化)

        - 本地运行时:Docker、QEMU、Apple VZ 三后端;云上走 Cua Cloud 的预热机器池

        - 定价:CPU $0.044625/vCPU/小时、内存 $0.0223125/GB/小时,按量计费

        - 合规:SOC 2 Type I、BYOC、on-prem 可选

        - 活跃度:1028 个 open issue、近 24 小时内有推送——迭代极快

2、五大组件:从驱动到基准

仓库是 monorepo,五大组件各管一段,拼成完整 CUA 栈。

组件矩阵:

        - Cua Driver:后台桌面自动化驱动——向指定窗口发点击与按键而不动系统光标、不抢焦点;可查无障碍树、捕获窗口状态;同一二进制跑成 MCP stdio 服务器、常驻守护或一次性 shell 命令,覆盖 macOS / Windows / Linux

        - Cua Sandbox / Fleets:沙箱运行时与弹性机群——本地 Docker / QEMU / Apple VZ 起一次性 GUI 环境;云端从形式化验证的预热池毫秒级领用机器,闲时缩到零

        - Lume:Apple Silicon 上的 macOS / Linux 虚拟机管理,基于 Apple Virtualization.Framework,Swift 编写

        - CUA-S1:专用 System 1 小模型家族——快速有界决策(如表单字段该填什么值),首个研究档案聚焦 forms;源码 MIT,权重与数据集在 Hugging Face

        - Cua Bench:任务构建、Agent 评测与轨迹导出——evaluator 判定目标是否完成,轨迹可导出为训练数据;模拟任务零依赖起步(无需 VM、Docker、模型 Key)

组件要点:

1. Driver 的后台模式是关键差异:传统桌面自动化抢鼠标毁体验,Driver 把操作投递到目标窗口——README 演示了两个 Driver 会话同时操作 LibreOffice 与 Inkscape 而终端保持前台

2. 一个驱动面管四 OS:MCP + CLI 统一接口,Agent 与人类用同一套 harness

3. CUA-S1 的定位克制:官方明言 System 1 只是工程类比——快而有界的决策,不替代通用 Agent 的规划推理

4. Bench 的数据生意:环境跑 rollout + evaluator 验证 + 人工审核金轨迹,按目标模型与难度分层交付"已验证轨迹数据集"

3、两条使用路径:驱动与机群

最常见的两种起步:给 Agent 装手(Driver),或给 Agent 租机器(Fleets)。

# 路径一:Cua Driver —— 本机后台驱动桌面应用
# macOS / Linux 安装
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

# Windows (PowerShell)
# irm https://cua.ai/driver.ps1 | iex

# 首个任务:连接 Agent,让它在计算器里算 6 × 7
# 并验证应用显示 42(官方教程)
# 接入方式:CLI / MCP stdio server / 类型化 SDK
# Claude Code / Codex / Cursor / OpenClaw 均有集成指南

# 路径二:Cua Fleets —— 云端机群领用桌面
# run.cua.ai 注册后,Python SDK 领用机器:
# from cua import Sandbox
# sbx = Sandbox()            # 从预热池领一台 Linux 桌面
# r = sbx.run("uname -a")    # 执行命令
# sbx.screenshot()           # 截图
# sbx.delete()               # 释放(注意清理,池会保留计费容量)

# 路径三:Lume —— 本地 macOS VM(Apple Silicon)
/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"
# lume create --macos tahoe && lume start ... 后 SSH 连接

# 路径四:Cua Bench —— 零依赖评测起步
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium
# 创建任务 → 跑参考解 → evaluator 报 reward 1.0 即通过

路径要点:

1. Driver 接入 Agent 的姿势:跑成 MCP 服务器挂给 Claude Code 等,或 CLI 直控——人与 Agent 共用一套面

2. Fleets 的预热池经济学:毫秒级领用换来"池在闲时也计费"——官方教程专门强调 cleanup 步骤

3. 本地与云共用 Sandbox SDK,但凭据、镜像与运行时要求不同——按 runtime support 参考选环境

4. Bench 起步零依赖:Python 3.12/3.13 + uv 即可,浏览器任务装 Playwright Chromium

4、训练与数据:机群的第二种用法

同一套机群,既能给训练循环供环境,也能直接产出验证过的数据。

两种消费模式:

        - 对着活环境训练:训练 / 评测循环指向预热机群池——按需领环境、走任务、收奖励、还回去,池为大批量并行设计

        - 直接拿验证数据:跳过 harness——官方在同一环境跑 rollout,交付经验证的轨迹数据集,按任务与界面划分,打包进你的数据管线

数据验证四层:

        - evaluator 在环:任务内置检查器判定 rollout 是否完成目标

        - 人工审核金轨迹:精选范围提供人工复核的金轨迹与步骤级标注

        - 可设验收线:目标模型、难度分层、界面组合自定义,交付前守线

        - 基准透明:Cua-Bench 公开榜显示最强前沿 Agent 在 25 个专家级 KiCad 任务中仅通过 6 个——难度与诚实度兼备

数据要点:

1. "环境即数据工厂"是 Cua 商业模式的独特角度:不止卖算力,卖的是带验证的轨迹

2. KiCad 基准结果(6/25)给行业泼了盆冷水:专业桌面软件上的 CUA 远未 solved

3. 快照与复现:从快照 fork、复现失败——RL 调试的刚需配置

4. CUA-S1 源码在仓库(MIT),权重另存 Hugging Face——许可按模型卡逐个核对

5、定位对比:CUA 基建三选一

把 Cua 与 E2B、Browser Use 放在一张桌上,三种执行环境路线清晰起来。

三者对比:

        - Cua:全 OS 桌面机群 + 后台驱动 + 评测基准 + 训练数据,开源核心 + 商业云(25.2k Star,MIT)

        - E2B:代码解释器沙箱为主打(安全执行 AI 生成代码),轻量快速,桌面 GUI 与跨 OS 覆盖弱

        - Browser Use:浏览器内自动化专精(约 88k Star 的网页 Agent 库),不出浏览器域

选型建议:

1. 要原生桌面应用、跨四 OS、训练评测一体 → Cua

2. 只要安全跑代码片段 → E2B

3. 只做网页操作 → Browser Use

4. 组合玩法:Cua 沙箱做外层环境,内部代码执行调 E2B,网页环节用 Browser Use——按界面类型分工

6、总结

Cua 是 trycua 公司的 computer-use 2.0 基建套件(约 25.2k Star、1.7k Fork、MIT 协议):五大组件各司其职——Driver 以后台模式驱动三平台原生应用(不抢光标、MCP/CLI/SDK 三接入)、Sandbox 与 Fleets 以 Docker / QEMU / Apple VZ 本地后端与云端预热池覆盖 Linux / Windows / macOS / Android 四 OS、Lume 管 Apple Silicon 虚拟机、CUA-S1 供表单决策专用小模型、Bench 做任务评测与轨迹导出;机群既服务训练评测循环,也直接交付验证过的轨迹数据集(evaluator + 人工金轨迹 + 可设验收线);商业云按量计费(CPU $0.045/vCPU/时口径),SOC 2 Type I 合规,Hermes、Factory Droid 等产品与 OpenAI、Qwen Code 生态均有集成。

适用与边界:它适合认真做 CUA 的团队——训练 RL、跑评测、生成数据、驱动真实桌面应用,开源核心 + 商业云的分层让原型到生产一条路走通;1028 个 open issue 与高频推送说明项目迭代极快,API 与组件边界仍在演进,采用时按当前文档校准;Driver 的后台投递依赖"应用与平台支持",边界情形见平台支持文档;KiCad 基准(最强 Agent 仅 6/25)提示专业软件场景远未成熟,预期管理要现实;OmniParser 组件 CC-BY-4.0、可选 ultralytics 依赖 AGPL-3.0,商用集成注意第三方许可组合;Fleets 计费的"池保留容量"特性要求严格走 cleanup 流程,否则闲时也在烧钱。

相关推荐

网站被注入恶意脚本排查实录:AI 辅助安全分析实战
置顶 精选AI

网站被注入恶意脚本排查实录:AI 辅助安全分析实战

网站被注入恶意脚本排查实录:AI 辅助安全分析实战某天收到华为云监管反馈,称个人博客网站存在色情违规界面。作为技术博主,这简直是晴天霹雳——网站一直正常运行,怎么会突然出现这类问题?经过排查发现,网站被注入了恶意跳转脚本。本文记录完整的排查过程,重点分享如何借助 AI 快速定位问题并修复,希望能给遇到类似情况的开发者提供参考。1、问题发现与初步排查收到监管反馈后,第一时间打开网站检查。首页看起来完

269
时隔三年,再次备份:从手搓博客到 AI 全面自动接管
精选AI

时隔三年,再次备份:从手搓博客到 AI 全面自动接管

时隔三年,再次备份:从手搓博客到 AI 全面自动接管今天打开尘封多年的备份目录,看到了一个熟悉的文件名——2023_07_09.sql。那一刻,恍如隔世。三年前的今天,我曾经认真地导出过一次数据库;三年后的今天——2026 年 7 月 9 日,自动备份启用。整整三年,1095 天,我的博客就这样安安静静地跑着,没有人备份,也没有人管,它就那么稳稳当当地活着。感慨万千,大概是此刻最准确的四个字——不

251
​Jev 详解:不做生成的判断模型
精选AI

​Jev 详解:不做生成的判断模型

Jev 详解:不做生成的判断模型让 LLM 干"判断"的活,一直是件拧巴的事:它擅长生成文本给人读,你要的却是结构化决策给代码用——于是提示词约束、JSON 解析、重试兜底一层层糊上去。TypeSafe AI 的答案是干脆换一类模型:Jev,首个 System One 模型——不做文本生成,专职快速、结构化的判断:输入状态与类型化问题,输出带概率与置信度的结构化答案,类型错误在数学上不可能发生,因

97