type
status
date
slug
summary
tags
category
icon
password
原始链接
- 论文 HTML:arXiv HTML 全文
- 论文 PDF:arXiv PDF
- 官方代码:THUDM/SCALE-CUA
- 复现说明:REPRODUCE.md
- VeriGen 文档:VeriGen/README.md
- 数据与模型:Hugging Face Collection
为什么今天选它
今天比较了四个近期对象:ScaleCUA 研究电脑操作 Agent 的可验证任务生成和在线强化学习;AgentCompass 把 Benchmark、Harness、Environment 拆开,统一二十多个 Agent 评测;PalmClaw 把 session、memory、skills、tools 和 agent loop 放进手机本地;Multi-Agent LLMs Fail to Explore Each Other 则研究多个 Agent 如何主动试探同伴能力。
AgentCompass 很实用,但【智汇AI】最近已经连续分析过多种评测和 harness。PalmClaw 的端侧执行值得单独写,当前公开实验却更窄。多 Agent 探索提出了好问题,离通用工程方法还有一段距离。
我今天选 ScaleCUA,是因为它同时处理了两个常被分开讨论的问题:怎样自动造出能判对错的真实 GUI 任务,以及怎样把昂贵的在线训练用在最值得学的任务上。论文于 2026 年 7 月 13 日提交,代码、数据、训练前后的模型和复现说明已经公开;主结果、拆分实验、人工核验和失败边界也写得比较完整。论文提交记录
先说结论:它更像一座“经验工厂”
普通电脑操作 Agent 的循环不复杂:看屏幕,决定下一步,点鼠标或敲键盘,再看结果。难点是训练。数学题有标准答案,代码可以跑测试,GUI 任务却很少自带可靠判定器。模型到底有没有把文件存对位置、表格公式改对、多个软件里的状态衔接好,往往需要人工检查。
ScaleCUA 的核心价值不是发明新的点击方式,而是把“任务、验收器、执行轨迹、训练样本”接成一个可扩大的闭环。它先在真实桌面环境里生成任务和可执行验收器,再让模型做这些任务,根据成功率选择下一轮最合适的难度,最后把长轨迹切成训练系统吃得下的片段。

图里的 68.7% 和 54.0% 分别是 Qwen3.5-9B 版本在 OSWorld 与 ScienceBoard 上的成功率。前者高于论文列出的开源基线 Kimi K2.5 的 63.3%,后者略高于 Claude Opus 4.6 的 52.7%,但仍低于 ScienceBoard 的人类结果 60.3%。这些数字说明训练管线有效,不等于电脑操作已经接近全面可靠。主结果表
系统怎么运作
整个过程分三段。第一段用 VeriGen 建立初始可验证任务池,并据此做初步训练。第二段让当前模型跑一批任务,再把成功和失败轨迹交回 VeriGen:失败任务被拆成更容易的子任务,已经做会的任务则被组合成更难的多目标任务。第三段进行在线强化学习,由 Frontier Sampling 选题,Visual Context Segmentation 处理长轨迹。框架说明

这张图最值得看的是两个回路。左侧回路负责把任务和验收器做对,右侧回路根据模型的实时成功率重新分配训练任务。训练数据不是一次性做完后封存,而是随着模型能力变化继续调整。
VeriGen:先解决“奖励从哪里来”
VeriGen 给三个独立角色分工。Proposer 根据环境知识和真实容器状态写出任务及验收逻辑;Judger 静态检查指令是否清楚、任务是否有意义、验收逻辑是否合理;Checker 进入桌面环境试跑,观察截图和可访问性树,确认目标真的做得到,验收器也能识别最终状态。VeriGen 方法
静态审查只能看出逻辑像不像对。动态试跑会碰到另一类问题:按钮不存在、初始状态不成立、文件路径错了,或者验收器检查了一个与任务无关的状态。ScaleCUA 把两种检查放在一起,这比单纯让另一个模型“评价一下任务质量”可靠得多。
论文还把执行轨迹拿来调难度。模型在某个长任务上失败,系统寻找最早偏离目标的位置,把此前的中间状态变成新任务起点,再为子目标生成独立验收器。模型已经稳定成功时,系统在同一应用内寻找相近任务,把多个目标串起来。这里做的不是固定课程表,而是根据真实失败位置改题。
规模来自环境层。共享探针把截图、可访问性树和动作接口暴露给外部 Agent,100 多个工作进程可以同时操作 100 多个容器。论文报告在 OSWorld 上生成了 2.4 万多个候选任务,最终约 3000 个通过全部筛选进入强化学习任务池。单个被接受任务平均花费 0.93—1.01 美元,平均端到端延迟 221.7 秒。任务规模与成本
“可执行”不等于“判得准”。完整流程生成的验收器可执行率是 94.5%;对 160 条轨迹做人工复核后,验收器与专家判断的一致率是 82.5%,其中 OSWorld 只有 78.0%。这意味着剩下的错误奖励足以污染训练,尤其是假阳性会教模型钻验收漏洞。人工核验
Frontier Sampling:训练最该学的那一段
有了大任务池,均匀抽样会浪费很多运行时间。太容易的任务已经没有新信息,太难的任务又几乎总失败。固定课程学习也不够灵活,因为同一个模型可能很会操作浏览器,却不熟悉表格或科学软件。
Frontier Sampling 为每个任务维护一个平滑更新的成功率。抽样权重在目标成功率附近最高,离得越远越低。论文把目标成功率设为 0.5,并保留 20% 的随机抽样,避免模型永远看不到边界外的任务。采样公式与参数
这个思路可以直白地理解为:主要练那些“有机会做成,但还不稳定”的题。拆分实验中,完整系统在 OSWorld 得到 68.7%;去掉 Frontier Sampling 后降到 63.7%。它不是全新的学习理论,更接近自适应课程学习和难例挖掘在 Agent 训练中的任务级实现。新意在于它直接跟踪每道可执行任务的通过率,并与大规模真实环境运行连在一起。拆分实验
Visual Context Segmentation:旧截图不是越多越好
长 GUI 轨迹会不断增加截图。全部保留,视觉输入越来越长,执行速度会明显下降;每一步单独切成训练样本,又会制造大量短片段,拖慢参数更新。ScaleCUA 保留完整文字历史,只让最近若干张截图进入视觉窗口。窗口满了以后,保存当前训练片段,丢掉最旧截图,再对保留历史重新处理。视觉上下文方法

这不是运行时 memory,也不是让 Agent 自动总结长期经历。它解决的是训练时的多模态上下文预算。OSWorld 保留 5 张近期截图,ScienceBoard 保留 8 张。论文报告单步训练总耗时从 750 秒降到 265 秒,端到端加速 2.83 倍;去掉这一组件,OSWorld 分数从 68.7% 降到 62.2%。效率实验与窗口设置
论文的案例也提醒了一件反直觉的事。截图太少,Agent 会忘掉文件命名要求;截图太多,早期终端和文件管理器画面会干扰当前动作,甚至把 Agent 带进重复循环。上下文工程不只是压缩成本,也是在控制哪些旧状态还值得被看见。窗口案例
结果该怎么读
ScaleCUA 在三个不同底座上都带来明显提升。以 Qwen3.5-9B 为例,OSWorld 从 41.8% 提到 68.7%。完整系统去掉 VeriGen 后回到 43.9%,说明最大增益仍来自可验证任务与训练数据;采样和上下文分段各自贡献了约 5—6 个百分点。模型结果与拆分
ScienceBoard 涵盖符号代数、分子可视化、地理信息系统、Lean 定理证明、天文模拟和科学文档编辑。Qwen3.5-9B 版本得到 54.0%,但各领域差异很大:天文任务是 60.6%,文档任务是 86.7%,GIS 只有 35.3%,定理证明只有 19.0%。一个总分会遮住产品上线时最重要的风险:Agent 在不同软件中的可靠性并不均匀。ScienceBoard 分项结果
还有一个容易忽略的限制:仓库为 OSWorld 和 ScienceBoard 分别发布了强化学习检查点。论文证明了同一套方法能在两个环境训练出强模型,没有证明一个统一模型已经同时掌握两套任务。模型列表
真正新的地方,哪些只是工程组合
多 Agent 的 proposer、judger、checker 分工不新。执行、批评、修复本来就是常见 Agent loop。使用 GRPO、异步执行引擎、大量容器和指数移动平均也都是已有工具。
ScaleCUA 真正推进了一步的地方,是让“验收器生成”进入真实环境闭环。验收逻辑不只经过语言模型审稿,还要在容器里试跑;失败和成功轨迹又反过来生成不同难度的新任务。这样,Agent 的经验不再只是日志,而是能变成带初始状态、明确目标和可执行奖励的新训练单元。
Frontier Sampling 的思想并不陌生,价值在于落到了每个真实 GUI 任务上。Visual Context Segmentation 也不是新的记忆系统,更像为多图长轨迹做的训练管道改造。论文最强的贡献不是某个孤立算法,而是把出题、验收、调难度、分配算力和处理长上下文接成了能运行的系统。
对产品和研发的启发
第一,先建设可验证任务,再谈 Agent 自我改进。真实业务里可以把验收拆成状态检查:文件是否出现、字段是否更新、审批是否完成、计算结果是否落在允许范围。只用模型打一个笼统分数,很难知道它究竟做对了什么。
第二,任务难度应该跟着 Agent 能力变化。稳定成功的任务降低抽样率,稳定失败的任务先拆小,最值得投入的是成功率在中间地带的任务。这个办法不只适用于强化学习,也适用于回归测试、人工抽检和灰度任务分配。
第三,失败轨迹要能生成下一批测试。找到最早偏离目标的步骤,比只看最终失败更有用。那个位置通常暴露了缺失技能、错误状态理解或工具接口问题,可以直接变成更小的训练题。
第四,上下文要按信息寿命管理。目标、约束和文字状态可以保留更久,重复截图和已经完成的局部画面应该更早退出。把所有历史都塞回模型,既贵,也可能降低成功率。
第五,验收器本身需要被评测。建议持续抽样做人机一致性检查,分别统计假阳性和假阴性,并保留可回放证据。Agent 学会绕过错误验收器时,训练分数越高,线上风险反而越大。
风险、局限和还没验证清楚的问题
论文每条轨迹最多 50 个动作,超长工作流没有覆盖。评测环境都是 Ubuntu 桌面,Windows 和 macOS 的跨平台泛化仍未验证。实验只覆盖约 8B—9B 级视觉语言模型,换成更小的端侧模型或更大的前沿模型,最佳采样参数和视觉窗口可能完全不同。论文限制
主训练使用 8 台服务器、共 64 张 NVIDIA H800,并发运行最多 600 个桌面容器,最多训练 1000 轮。2.83 倍加速很有价值,但它是在高成本基础设施上的相对改进,不代表普通团队可以轻易复现整套训练。训练配置
人工核验样本只有 160 条。82.5% 的总体一致率也说明验收器离可靠还有距离。论文给了假阳性和假阴性统计,却没有专门报告模型是否学会利用验收漏洞,也没有展示对提示注入、恶意文档或被污染界面的防护。
任务由同一批环境知识、软件和验收方式生成,可能学到基准环境的操作习惯。作者做了训练与测试重叠检查,但在真实企业软件、不同语言界面、版本升级和网络波动下是否仍有效,还需要外部复现。
代码、数据和模型已经公开,这是加分项。不过仓库仍很新,部分 OSWorld 任务需要测试账号、本地缓存、虚拟机镜像和代理设置;运行产物、历史结果和私有环境文件没有随仓库提供。公开材料足够检查方法结构,完整复现实验仍有较高门槛。仓库说明
今日沉淀
- Agent 训练的瓶颈常常不是任务数量,而是有没有可信的验收器。
- 最值得训练的是“快会了但还不稳”的任务,不是最难的任务。
- 成功轨迹适合加难,失败轨迹适合从最早偏航处拆小。
- 视觉历史有保质期;旧截图过多会让长任务更容易跑偏。
- 验收器也会犯错,必须持续检查假阳性、假阴性和绕过行为。