本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
模型 & 产品
本窗(8 月 12 至 21 日)没有厂商旗舰闭源模型配发布博客落地。工业界最贴本栏目主题的动态是 Anthropic 一条 agent 工具链发布;另有一份提交在窗内的开放模型技术报告(MOSS-VL),按往期先例一并收录,需说明后者是 arXiv 技术报告、而非厂商发布页。
Claude Platform:computer use + browser use tool + Skills API + Files API
8 月 20 日,Anthropic 宣布 Claude Platform 上四项能力正式 GA:computer use、新增的 browser use tool、Skills API 与 Files API。属 developer-blog 级的功能发布,定位是「agent 工具链动态」而非模型发布。
- computer use:更新后的工具支持一个回合内执行多个动作(此前一次模型调用只做一个),任务在更少调用、更少时间内完成;可用于没有自动化接口的应用,并进入 HIPAA 合规范围(BAA 下)。
- browser use tool:computer use 的新增项,在同一多动作回合之上加入页面结构感知——agent 按页面元素定位而非屏幕坐标,Web 应用里点击/输入更可靠。
- Skills API / Files API:skill 是「按需加载的指令/脚本/模板文件夹」,Skills API 让你上传、版本化自己的 skill 并在任意请求上挂载,跑在 Claude 的代码执行沙箱里、无需自己托管;Files API 是 agent 读写文档的存储,传一次按 ID 引用、不必反复发送。
- 客户侧佐证:Asteroid 团队称在无 API 的医疗/保险系统上,最长的 claims 工作流从 32 分钟降到 13 分钟、单任务成本降约 30%、完成率 100%(改动前后同一套 prompt)。这属于厂商博客引用的一手案例,具体普适性待独立验证。
- 生态:Skills API 与 Files API 同时经 Microsoft Foundry 提供;computer use / browser use tool 将上 Google Cloud Vertex AI。与已 GA 的 code execution、web search 同属一个工具面。
MOSS-VL(开放视觉语言模型技术报告)
8 月 15 日提交、署名 MOSS 团队(含复旦大学 Xipeng Qiu 组)的开放 VLM 技术报告,定位是把「实时交互——边感知边说」做成第一性能力。
- 架构:11.3B 参数;语言解码器只通过 gated cross-attention 看视觉输入,生成中可自然吸收新来的帧;视觉 token 不占解码序列,随视觉上下文增长、time-to-first-token 优势扩大(对同基座 Qwen3-VL-8B 从 2.8x 到 5.1x)。
- 训练:合成交互语料监督「何时说、何时静默、何时修订」;阶段化课程,把实时特化训练集中在一个轻量最终阶段、踩在强离线底座之上。
- 评测:离线版 MOSS-VL-Instruct 在相当规模下与竞品持平、领先时序推理视频集;实时版 MOSS-VL-Realtime 在四个流式基准里三个平均最优(第四个第二),三个专测「主动行为」的子集全胜——OmniMMI Proactive Alerting 上 66.0 vs 最佳基线 37.5。
- 开放:发布全部 5 个 checkpoint、训练课程与实时推理代码。
- 局限:未给通用多模态能力的完整横向榜;「实时」表现依赖基准设计,离线-实时两版能力切割的边界看全文。
论文精选
每篇附 arxiv 链接,并给出「实用性 / 创新性」评分(满分 5)。本批 v1 提交集中在 8 月 12 至 19 日(UTC),均已折算 +08:00 核实落窗;定量结论以摘要口径为准,细节以全文为准。
本窗没有单一主题主线,取样上 harness 侧尤其密集(harness scaling 刷分、harness 上黑盒 RL、验证门控 harness、ACID 化 agent 运行时),这只是本期取样、不代表当周主线;Eval 线两条都是「过程级/失败级」诊断而非新刷分榜。
LLM / Agent
UI-Mate — 带上下文示范的开放权重基础 GUI agent
- https://arxiv.org/abs/2608.15930 | 实用性 5 / 创新性 4
- Tencent Hunyuan 等 29 位作者(含 Zihan Ding、Lei Ke);cs.AI / cs.CV;8 月 16 日(+08:00)提交(技术报告,65 赞)。
核心动机:基础 GUI agent 要落地难在三件事——训练数据稀缺且偏、用户 prompt 含糊、执行不可靠。日常流程依赖用户特定工具与隐性惯例,没说出口的指令会在不同运行间产生任意差异。
横向对比:UI-Mate 集成「环境接地训练栈」与「上下文示范学习」两条线。训练栈是闭环数据引擎:任务生成、环境搭建、rollout、过滤、能力均衡、SFT、在线 RL 靠统一 task-verifier bundle 在超并行环境里自动化;示范学习把多模态示范转成子任务级工作流,可跟随相关示范步骤、并从实时界面重新规划。结果:UI-Mate-27B 在 OSWorld-Verified 77.0%、WindowsAgentArena 66.2%,称开放权重 SOTA;新增 OSWorkerBench(41 应用、100 个长程办公任务),比基座 Qwen3.6-27B 高 17.7 / 24.5 分;33 个 self-demo 子集里,一条示范把严格成功率从 17.2% 抬到 35.4%、progress 从 67.9% 到 81.1%。
优点:「示范即门槛」的评测设计(self-demo vs variant-demo)把「给一条示范能不能涨」从玄学变成可测指标,对从业者极实用;一条示范让长程可靠性近乎翻倍,说明瓶颈常在流程而非单步能力;开放权重、训练栈全开源,可复现门槛低;41 应用覆盖真办公软件而非玩具界面。 缺点:技术报告、完整训练配方细节待全文;示范增益主要验证在 self-demo 子集,variant-demo(非相同任务的示范)增益是否同样显著要看报告;OSWorld/WindowsAgentArena 的对比基线更新快,SOTA 声明是快照;27B 的落地成本仍偏高,小模型版本未验证。
SA-MRPO — 饱和感知优势重加权的多奖励 RL
- https://arxiv.org/abs/2608.16072 | 实用性 4 / 创新性 4
- 9 位作者(UCSD 系,含 Yixuan Wang、Nuno Vasconcelos);cs.LG / cs.AI;8 月 17 日(+08:00)提交(145 赞)。
核心动机:RL 后训练里多目标优化普遍做法是「先把奖励向量加权标量化、再组内标准化」。作者指出这个设计有两个病:不同奖励轮廓的 rollout 可能拿到相同的 advantage;所有目标无论饱和与否都用固定相对权重,梯度预算继续砸向已解决的目标、而不是还有余量的。
横向对比:SA-MRPO 把每个奖励目标独立标准化,再按批次级目标饱和估计自适应折扣它的贡献,把优化火力动态转向欠优化目标,同时维持已满足目标不掉。关键洞察:饱和感知重加权不只是缩放幅度,能反转一次更新的符号。数学推理二/三目标组合下,12/15 项对比超 GDPO、AIME24 最高 +5%;自适应推理五基准全涨、平均 +3.8%、AMC23 最高 +9.2%;编码 pass rate 最高 +2.3%,且简单目标维持在已满足水平附近。
优点:指出「标量化 + 组内标准化」这个默认流程的真实缺陷,痛点真实;改动是训练目标层的小手术,可平移到 GRPO/GDPO 系方法;「可反转更新符号」的机制分析比纯刷点有解释力;多域(数学/推理/编码)验证了普适性。 缺点:饱和估计的批次级指标带启发成分,阈值敏感性要看全文消融;对比基线主要是 GDPO,更广的 RL 方法面待覆盖;提升集中在相对基线的点,绝对增益幅度不算爆炸;在线 RL 的稳定性/计算成本未展开。
Large Discovery Models — 经验接地、模型驱动的开放式搜索
- https://arxiv.org/abs/2608.15669 | 实用性 4 / 创新性 4
- 12 位作者(Yangtze AI Lab,含 Jun Wang);cs.LG;8 月 16 日(+08:00)提交(61 赞)。
核心动机:科学发现常在「昂贵求值的目标 × 巨大结构化的开放假设空间」(分子、蛋白序列、程序)上做优化。LLM 提供表达性先验,但它的似然与自我评估在分布外候选上不可靠,当不了校准过的目标代理。
横向对比:LDM 把生成模型与贝叶斯非参数奖励代理耦合:生成模型提候选、代理预测性能并量化不确定性,用 uncertainty-aware 价值引导生成/精炼/选择;发现记忆与代理随每个新观测持续更新。在神经网络训练、抗体设计、分子优化三个场景,对比 LLM-only reflection 与传统统计搜索:验证集 BPB 降幅 2.4x、结合能相对降 18.2%、分子多目标性能相对提升 >60%。
优点:把「LLM 当生成先验 + 贝叶斯代理当校准器」的架构落到三个不同模态/目标场景,通用性有实证;不确定性量化直接进搜索决策,天然规避 LLM 自我评估不可靠的问题;记忆持续更新、吃新观测,贴合真实实验流。 缺点:三种场景是否代表「开放假设空间」的普遍形态存疑,跨域迁移未测;与最强专用优化器(贝叶斯优化/强化学习专线)的对比强度看全文;BPB/结合能等指标受任务构造影响大;训练与推理成本相对传统搜索更高,性价比要按场景评估。
Harness / 工程实践
StateM — 用 harness scaling 把 Terminal-Bench 2.1 刷到 95.3%
- https://arxiv.org/abs/2608.15089 | 实用性 5 / 创新性 4
- 4 位作者(Ziheng Qin、Yaxin Lu、Zhangyang Atlas Wang、Kai Wang);cs.AI;8 月 15 日(+08:00)提交(430 赞,当期热度第一)。
核心动机:长程 agent 即使底层模型能解每一步也会整体失败——丢可变状态、不重新激活早前教训、跳过已知流程、过早收手。作者把注押在不改模型权重、只改执行系统的 harness scaling 上。
横向对比:StateM 是一个「agent-native 运行时」,围绕持久状态、阶段局部上下文、受检迁移、可恢复 runbook、带版本的程序化实践组织执行。Terminal-Bench 2.1 上把 GPT-5.5 xhigh 从 83.1% 抬到 92.1%(reference),GPT-5.6 Sol Ultra 91.9%;Sol xhigh + StateM 到 95.3%(445 次试验、89 个任务全部至少成功一次);frozen profile 把 GPT-5.6 Luna 从 76.7% 拉到 85.4%(超 84.9% 的 Sol xhigh reference)。成本侧:同一 runtime + runbook + 规则下,约 $38 适配让 DeepSeek-V4 Flash 从 82.7% 到 88.1%(标准超时)/ 89.1%(88 任务公共核心),最终评分 API 花费约 $15 vs GPT reference 的 $574.68。另有 BusinessBench 上 family-specific runbook 的 held-out 增益与「concrete rules 在共享执行结构时泛化」的结论。
优点:把「harness 增益可度量、可迁移」钉在硬数据上——runbook 不改迁移到别的底座、别的时间线,这比一次性的 prompt 调优可信得多;$15 vs $574 的成本对照对工程决策极有说服力;把 postmortem 结论固化成「可执行的持久前置条件与规则」,是让复盘真正生效的系统化做法;不依赖权重更新,任何模型即插即用。 缺点:95.3% 是 Stacked 全 harness + 强基座的结果,各组件贡献需消融确认;runbook 本身是人工/半自动产物,「扩写到新任务域」的成本没量化;只报 Terminal-Bench / BusinessBench 两个面,跨工具链泛化待证;「frozen profile 跨底座迁移」强依赖同构执行结构,异构场景可能打折扣。
AI4AI at Test-Time — 用 harness 做强→弱能力迁移
- https://arxiv.org/abs/2608.12307 | 实用性 4 / 创新性 5
- 9 位作者(UIUC + Salesforce 系,含 Heng Ji、Silvio Savarese、Shelby Heinecke);cs.LG / cs.AI / cs.CL;8 月 12 日 17:53 UTC = 8 月 13 日(+08:00)提交(111 赞)。
核心动机:蒸馏把大模型能力传给小模型,靠的是更新后者的参数(teacher forcing、on-policy distillation 等训练期方法)。作者反问:能不能不碰参数、纯推理时完成这种转移?
横向对比:作者研究 strong-to-weak scaffolding——强 builder 模型为弱目标模型构造推理期 harness,后者零参数更新。四个 Theory-of-Mind 基准上,builder 用 5% 数据做验证集多轮迭代 harness,最终在全集上测:目标模型平均成绩从 0.49 到 0.91、几乎翻倍。机制分析显示增益主要来自「把不稳的模型推理卸到确定性代码、基准特定路由、严格答案格式强制」,而非让目标模型多想/多采样;builder 推理努力与 harness 质量单调正相关;平台效应远小于 builder 自身能力;弱目标模型受益最大。
优点:「harness 代蒸馏」把能力迁移从参数空间搬到推理空间,概念新且有反直觉的强结果(0.49→0.91);给了可操作的机制归因(确定性代码 > 多思考),不是黑盒调参;对「弱模型 + 强 builder」的资源受限场景直接可用;验证了推理期 harness 设计与训练期蒸馏的互补性。 缺点:只在 ToM 基准上验证,向代码/数学/agent 任务的外推是开放问题;builder 迭代 harness 的轮次与成本未展开,可能不便宜;5% 验证集假设限制了无验证集场景的可用性;「目标模型几乎不思考」的结论暗示这类 harness 是给特定任务配的,通用性存疑。
ClawGym II — 在 agent harness 上做黑盒 RL
- https://arxiv.org/abs/2608.16798 | 实用性 4 / 创新性 4
- 20 位作者(中国人民大学,含 Wayne Xin Zhao、Mingjie Tang);cs.CL / cs.AI;8 月 17 日(+08:00)提交(40 赞)。
核心动机:agent harness 显著提升长程任务表现,但「穿过复杂 harness 做强化学习」几乎没人碰——把 RL 训练扩到长程 agent 任务有根本性难点(奖励稀疏、harness 执行不可微分、并发 rollout 基础设施)。
横向对比:ClawGym II 给出一套统一黑盒 RL 框架:沙箱执行基础设施把任务环境与 harness 隔离在临时沙箱里做大规模并发 rollout;在模型边界放 serving proxy 抓模型调用,把多轮轨迹重构成 prefix tree,再同时适配 critic 式 PPO 与 critic-free GRPO 在树上优化;全流程保持训练-推理一致,并引入 mix-harness 训练——单个模型被异构 harness 联合优化。用 Qwen3-30A3B:OpenClaw / Claude Code 上黑盒 RL 把 ClawGym-Bench Pass@1 提升 9.98 / 14.81 分,200-400 步内稳定;在 JobBench、OfficeQA 上也有一致增益。
优点:直接回应「harness 上的 RL 怎么做」这个工程空白,黑盒 + prefix tree 的做法绕开了 harness 不可微分的问题;mix-harness 训练让一个模型同时吸收异构 harness 的监督,是个干净又实用的扩展;训练稳定性(200-400 步)有硬数,不是 demo 级;沙箱化并发 rollout 的设计对真实基建有直接参考。 缺点:黑盒 RL 的样本效率与计算成本未详细披露;Pass@1 增益相对基线的点有限,绝对水平看基准难度;训练-推理一致性靠 serving proxy 细节支撑,harness 版本漂移时的稳健性待证;OpenClaw/Claude Code 是已发布 harness,对自研 harness 的适配成本未知。
Agentic Transaction — 给 agent 系统上 ACID 语义
- https://arxiv.org/abs/2608.13900 | 实用性 4 / 创新性 4
- 3 位作者(清华大学,含 Guoliang Li);cs.DB / cs.AI / cs.CL;8 月 14 日(+08:00)提交(26 赞)。
核心动机:LLM agent 正从对话助手变成在持久环境里跑长程任务的自治系统——推理、工具调用、写代码、改工作区。它们遇到的问题与数据库事务系统当年面对的同类:可靠执行、一致结果、安全并发、持久状态。但 agent 侧没人用系统化的方式回答。
横向对比:作者提出 agentic transaction 概念,把经典 ACID 重释为 agent 执行的四条语义保证——语义原子性、语义一致性、语义隔离、语义持久性。落地为「ACID 兼容的数据 agent」:探索-执行-验证循环、事务化 skill hub、基于置信分歧的验证、语义依赖感知隔离、事务感知状态管理。在广泛使用的基准上比最强 agent(含 Claude Code)平均高 10.6%。
优点:把数据库领域成熟的事务抽象搬进 agent 系统,概念转译清晰,为「agent 可靠性」提供了本应是常识的架构语言;四条语义保证各自有可指认的实现机制,不是口号;在模型不确定性 + 动态环境下强调「验证、回滚、隔离」,直接对冲 agent 执行不可靠的痛点。 缺点:偏概念 + 单点验证,覆盖的 agent 类型(数据 agent)有限,扩展到编码/通用 agent 待证;10.6% 的平均增益依赖基准构成,最差场景是否负收益要看细表;事务开销(验证、回滚的成本)未量化,长程任务里可能是新瓶颈;与既有编排框架的集成路径未给出。
SemaPLC — 验证门控的 agent harness 做 PLC 代码生成
- https://arxiv.org/abs/2608.18565 | 实用性 4 / 创新性 3
- 13 位作者(美的 AI 研究中心);cs.SE;8 月 19 日(+08:00)提交(37 赞)。
核心动机:LLM 已经能独立生成 PLC(可编程逻辑控制器)程序组织单元,但「生成的逻辑能不能并进现有 PLC 项目并正确跑起来」只在很有限的测试里查过。工业场景里「模型自认为够了」显然不是完成标准。
横向对比:SemaPLC 是一个用常规工具拼装、但被严格完成规则约束的验证门控 harness——任务只在「外部检查确认」后宣告完成:规格检查、编译检查、真实运行时行为检查。117 个独立 POU 任务上七个模型拿到最高严格验证通过率(平均 72.6%);65 个项目上下文任务里,集成编译、静态行为、动态行为三层全最高。最亮的是动态行为:把生成逻辑与参考逻辑部署到真实 PLC 运行时比对执行 trace——所有方法静态分差在 10 分内,动态分却拉开到 22.4~31.4(基线)vs 52.2(SemaPLC)。
优点:「任务完成 = 外部检查确认」这个完成规则的工程纪律,比「模型自评够了」强一个量级,对任何落地 LLM 代码生成的人都是直接可抄的实践;动态运行时 trace 比对揭示了静态打分骗人的方式,方法论有价值;跨 7 模型验证说明增益来自 harness 而非特定底座;开源。 缺点:只覆盖 PLC(工业逻辑)这一形态,向通用软件代码生成的迁移待证;「外部检查」依赖测试/规格完备,规格缺失时无从下手;项目上下文轨只有 65 任务,规模偏小;真实 PLC 运行时验证的部署成本(设备、时长)未量化。
EvoX Genesis — 持久递归世界实现自治软件演化
- https://arxiv.org/abs/2608.10450 | 实用性 4 / 创新性 4
- 4 位作者(香港理工大学,含 Ran Cheng);cs.SE / cs.AI / cs.MA;v1 8 月 11 日、v2/v3 8 月 12/16 日更新入窗。
核心动机:复杂软件演化的时间尺度超过任何单个编码 agent 的寿命。多数 agent 系统靠持久会话、记忆、manager、共享上下文来维持连续性——作者换了个思路:让软件项目持久,agent 保持有限寿命。
横向对比:Genesis 把软件表示成「持久递归世界」——每个局部世界由接受版本 + 仓库路径定位,有限寿命 agent 提议局部改动,递归委托把工作跨路径搬,只有被接受的后果推进持久版本史。实测:用 DeepSeek V4 Flash 从零造一个 Rust 版 C 编译器(约 25 万行),跑了 120 小时、归档 1000+ agent episodes、token 花费仅 $44,通过完整 c-testsuite 与大部分 LLVM/Csmith 测试;另一 GLM 5.2 生成的编译器世界里,agent 反复替换后继续开发、测试性能保持;还重写了 13 个 MESA 模块(10 万+ Fortran 行 → 近 9 万 Rust 行),六个数值负载中位加速 1.55–6.87x。
优点:把「软件系统演进」与「agent 生命周期」解耦,是对「持久 agent 会话」范式的有力反面;$44 完成 25 万行编译器是罕见的低成本实证,规模故事有说服力;递归委托 + 接受制版本史提供了清晰的并发/可靠性纪律;独立复刻已有系统的能力(MESA 重写)比只写新玩具更能说明普适。 缺点:v1 在窗外、靠窗内更新入窗,严格按首次提交算属旧作;「通过测试」不等于生产可用,25 万行编译器在真实工具链里的质量未独立验证;agent episodes 的失败率、重试成本未披露,$44 可能掩盖大量试错;持久世界的高层设计(谁来接受、如何防回归)细节待全文。
Eval / 评测
AutoResearchEval — 100 个真实科研任务的过程级失败诊断
- https://arxiv.org/abs/2608.14905 | 实用性 4 / 创新性 4
- 9 位作者(Prentis AI);cs.CL;8 月 14 日 v1、8 月 19 日 v2(+08:00)(28 赞)。
核心动机:AutoResearch(一个系统从假设到成文的完整科研流程)范式成型了,但现有评测信息量很小——任务范围窄、只测结果不测过程、失败诊断缺乏系统性覆盖与产物级可见性。
横向对比:AutoResearchEval 有 100 个任务,接地在 7 个学科已发表的前沿科学上、覆盖完整科研生命周期(构思/检索/执行/分析/写作/评审)。8 个 harness-model 组合跑出 800 条轨迹并做过程级标注,归纳出 ARFT(AutoResearch Failure Taxonomy)45 条失败模式。核心结论:失败收敛到一个总限制——当前 agent 缺 metacognitive loop(对照「产出 vs 发现」、不对就改、质疑路径本身是否扎实);该模式在全部 8 个组合(含最强模型)里复现,说明缺陷在模型层而非某个 scaffold,编排层干预能否补上是本文未测的开放问题。
优点:「诊断失败而不是刷分」的评测姿态正是 eval 最缺的,45 条可操作的失败模式对做科研 agent 的人是直接查表;用 agent-as-a-judge + 人类校准做轨迹级归因,方法学可复用;「缺陷在模型层」是个反直觉且重要的信号——别指望换 harness 解决一切;产物级可见性让失败可被审计。 缺点:100 任务 × 8 组合的标注成本高,扩展性受限;agent-as-a-judge 的人类校准过程本身有判据偏差风险;ARFT 的 45 类粒度过细、类间重叠待处理;结论指向模型层、但未给出模型侧干预实验,是诊断而非处方。
Beyond Final Scores — 长程 AI 研发 agent 的过程级系统评测
- https://arxiv.org/abs/2608.13417 | 实用性 4 / 创新性 4
- 13 位作者(美团 LongCat 团队);cs.AI;8 月 13 日(+08:00)提交(52 赞)。
核心动机:自治 agent 越来越能通过长程实验改进模型/系统/产物,但现有评测只看最终分数——既看不到增益/损失发生在哪一步,也不知道累积经验是否真的改善后续决策。
横向对比:对 7 个前沿模型在 36 个长程任务上做系统评测,用基于规则的指标刻画运行内行为(Solution Framing / Execution / Feedback Control),并用受控对比测经验复用。结论:当前 agent 更像「工程优化器」而非完全自治的研究者——能提出并实现可行方案,但跨运行表现波动大、最强方案主要是改编/组合既有技术、真正的方法新颖性罕见;相同最终结果背后可能是不同流程瓶颈;经验复用既能帮助也能误导后续决策;harness 设计显著影响表现稳定性。
优点:把「过程质量」拆成可打分的三个维度,比终分多一个数量级的信息;「经验复用会误导」的发现对 memory/experience harness 设计是直接警告;7 模型 × 36 任务的规模在过程级评测里算扎实;给出的改进方向(训练、推理策略、经验管理、harness 设计)具体可落地。 缺点:36 任务长程实验的构成与领域覆盖看全文,代表性待评估;规则化评分是否忠实反映研究质量有主观性;「方法论新颖性罕见」是观察性结论,受任务池本身的新颖度上限影响;与 AutoResearchEval 同属诊断路线,结论互证但都非处方。
世界模型与具身
Zetta ζ — 闭环具身 harness 的自我演化
- https://arxiv.org/abs/2608.16590 | 实用性 3 / 创新性 4
- 15 位作者(含 Ting Cao、Yunxin Liu);cs.RO;8 月 17 日(+08:00)提交(205 赞)。
核心动机:具身 agent 越来越被用来补端到端策略模型的短板,但 agentic 路径没实现物理执行里的闭环学习——现有 harness 基本开环:rollout 用固定技能、事后才反思。事后反思管不了执行中发生的事,因为物理交互需要以远超今天大型 agentic 模型的频率跟踪动态机器人-环境状态。
横向对比:Zetta 是闭环具身 harness,在保持 base 策略冻结时在线演化基于代码的运行时批评者与恢复技能。三个时间尺度分离的循环提供「动作频率治理、rollout 级批评-恢复提案、验证门控技能更新」;配 Z-Infra(把 agent 逻辑与异构执行资源解耦的 rollout 基建)。在当前 rollout 预算下,LIBERO-Pro 90.8%、RoboCasa 93.6%,推理 11.1x 加速;成功随自探索经验增长;技能零样本迁移;出现机器人版的 “Aha Moments”。
优点:把 harness 自演化从「思考/语言 agent」扩展到「物理执行 agent」,且解决了高频动作 vs 慢推理的时间尺度矛盾(三段循环是干净的设计);「在线演化批评者 + 验证门控技能」让物理试错被纪律化;冻结 base 策略意味着可直接叠在现成 VLA 上;11.1x 推理加速有工程价值。 缺点:只在仿真基准(LIBERO/RoboCasa)验证,真机迁移未知;90.8%/93.6% 是当前 rollout 预算下的成绩,预算扩大后的边际递减趋势未给全;「Aha Moments」是定性叙事,缺少量化佐证;闭环批评者在更复杂/更混乱任务里的鲁棒性待证。
PlayWorld — 用 agent 玩家评测交互式世界模型
- https://arxiv.org/abs/2608.13552 | 实用性 3 / 创新性 4
- 12 位作者(香港大学 + 快手,含 Hengshuang Zhao);cs.CV;8 月 13 日 v1、8 月 14 日 v2(+08:00)(81 赞)。
核心动机:视频世界模型评测难在公平比较——真实用户是「抱着长程目标去交互」来评估的(转 360 度看环境是否一致、走进水里看水波真不真)。但达成同一目标的动作序列因模型而异,固定动作条件评测没法做跨模型对比。
横向对比:PlayWorld 改用多模态 agent 玩家朝指定长程目标与世界模型交互。基准含 171 个场景、各带目标,沿四个核心维度评测:几何一致性、交互保真、离屏演化、洞察演化,外加基础视频质量与可控性。九个 SOTA 世界模型实测:长程交互目标上仍然不可靠,尤其空间一致性维持与持久状态演化是共同短板。
优点:「用 agent 当玩家、按目标而非动作序列评测」直接解决跨模型交互对比的公平性痛点,是评测范式上的实质进步;四个维度分离了「一致性/保真/演化」这些容易混为一谈的能力;171 场景规模足够给趋势性结论;揭示的共同短板(持久状态演化)给世界模型训练指了方向。 缺点:agent 玩家自身能力成为评测变量,弱者测不出模型上限;目标设计(171 个)是否覆盖真实用户意图有构造偏差风险;四个维度的打分规则可复现性待公开细则;结论集中在「都不行」,对改进的指导更多是负向的。