本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。

本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 9 日至 13 日:主流模型厂商处于发布淡季(上期已覆盖 GPT-5.6 与 Gemma 4),故产品线只收一条落在窗内、且与栏目主题直接相关的 harness 迭代,重心放在论文。

模型 & 产品

Claude Code(第 28 周迭代 + v2.1.207)

Anthropic 的编码智能体客户端本期(第 28 周,7 月 6–10 日,及 7 月 11 日的 2.1.207 版本)密集迭代,本身不是新模型发布,而是「智能体 harness」这层工具的持续打磨——主线是把自主运行更安全桌面端能力补齐同时推进。放进本栏目,是因为它正是「模型不变、靠 harness 提效」这条工程路线的一手样本。

  • 能力更新:第 28 周引入 Desktop 端内置浏览器(in-app browser),把 /doctor 从单点检查升级为完整环境体检,并带来 auto mode 的安全性改进与 agent view 的观感升级。7 月 11 日的 2.1.207 进一步把 auto mode 在 Bedrock / Vertex / Foundry 上默认开启,Bedrock 侧模型升级到 Claude Opus 4.8,并修复了一批冻结、崩溃、worktree 与插件相关的问题。
  • 生态:更新集中覆盖 Bedrock / Vertex / Foundry 三条企业部署渠道;结合此前 7 月 1 日 Sonnet 5 设为默认、7 月 2 日 Claude in Chrome 转正,可见近两周 Claude Code 的重心是把「默认放手让智能体自己跑」这件事在企业与桌面场景里坐实。
  • 定性:都是增量更新而非能力跃迁,观察价值在「厂商如何把 auto mode 默认化并配套安全护栏」这一 harness 设计取向,而非某个跑分。

论文精选

每篇附 arxiv 链接,并给出「实用性 / 创新性」评分(满分 5)。均为 7 月 9–10 日提交的预印本,部分定量结论以摘要口径为准,细节以全文为准。

LLM / Agent

UniClawBench — A Universal Benchmark for Proactive Agents on Real-World Tasks

核心动机:现有主动式(proactive)智能体评测多依赖沙盒环境与单轮范式,任务类别又把多种能力混在一起,导致「失败了却说不清败在哪一环」。

横向对比:UniClawBench 围绕五种核心能力组织——技能使用、探索、长上下文推理、多模态理解、跨平台协调;共 400 条双语真实任务,在真实 Docker 容器里用细粒度、分步的完成度 checkpoint 打分。评测走闭环:一个执行 agent、一个隐藏的 supervisor agent、一个 user agent,模拟多轮反馈又不暴露评分标准;并跨多个智能体框架测试,以把底座模型能力与框架设计拆开看。摘要未给逐模型分数。

优点:真实容器 + 分步 checkpoint,比沙盒单轮更贴落地;跨框架设计能隔离「底座 vs harness」的贡献;双语、闭环多轮更接近真实使用;能力五分法让失败定位更清晰。 缺点:摘要无逐模型成绩,难判基准区分度与整体难度;400 任务属中等规模;隐藏 supervisor 的评分一致性与「主动性」判定边界待验证;容器化维护成本高。

Ideas Have Genomes — Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

核心动机:科学想法像生物基因组一样,从前作里继承机制、修补局限、重组旧件;但现有基准几乎不能反映 AI 是否真的在遵循这种「继承结构」。

横向对比:论文提出 IdeaGene 框架与 IG-Bench——把每篇论文/提案拆成一组最小、带类型、证据锚定的 Idea Genome 对象,用 GenomeDiff 对齐它们,追踪继承、变异、丢失、外部引入、新插入等六种演化动态;配两套评测:IG-Exam(闭式血统推理)与 IG-Arena(生成,用血统条件化的 Population-Evolution Score / PES 打分)。规模上有 1961 条 golden lineage trace、1085 个 Idea Genome 对象、920 条 GenomeDiff、覆盖 10 个学科域,IG-Exam 含 42 类任务、1029 个实例,测了 14 个「LLM 科学家」。关键发现是一个组合瓶颈:最佳系统在血统推理上 exact accuracy 只有 27.3%,且喂进结构化血统上下文只是重排了系统名次,而非对所有参与者普遍有帮助。

优点:把「站在前人肩膀上」形式化为可测的对象 + diff,视角新颖;规模与学科覆盖都不小;用 27.3% 这个硬数字戳破「AI 会做科研继承」的乐观预期;对自动科研 / 想法生成方向有直接指导。 缺点:Idea Genome 抽取质量强依赖构建流程;PES 这类血统条件化打分主观性较高;27.3% 说明离可用尚远;纯基准工作、无配套新方法。

S-TTT — Self-Guided Test-Time Training for Long-Context LLMs

核心动机:把上下文窗口撑大,不等于模型会用长输入——随输入变长,定位相关证据越来越难,准确率反而下滑。测试时训练(TTT)能救场,但在全上下文上做太贵、在随机片段上做噪声太大;作者实测发现 TTT 对「训练片段质量」高度敏感:随机 span 反而伤性能,oracle span 才显著有用。

横向对比:S-TTT 的做法是先让模型自己识别「该学的证据 span」,再只在这些选中的 span 上跑标准语言建模目标做适配,而不是啃整段上下文。在 LongBench-v2 与 LongBench-Pro 上,用 Qwen3-4B-Thinking-2507 与 Llama-3.1-8B-Instruct 两个底座测,两者都提升,最高达约 15% 的相对提升。

优点:抓住「TTT 关键在片段质量」这一实证洞察,动机扎实;自引导选证据 span,同时绕开全上下文的成本与随机片段的噪声;即插即用于现有模型;双基准、双底座交叉验证。 缺点:效果吊在「模型自选 span 是否选得准」上,选错即退化;TTT 每次查询仍有额外计算与延迟;仅测两个中小模型;给的是相对提升口径,绝对增益与更长上下文的外推未展示。

CausalDS — Benchmarking Causal Reasoning in Data-Science Agents

核心动机:现有基准两头不靠——要么是脱离真实数据分析的符号化因果推理测试,要么是缺乏严谨因果结构的数据分析测试;且已有因果数据集多靠人工样例 + 有限模板变体,而非系统化生成的新颖结构。

横向对比:CausalDS 把每个实例做成一个「场景」——采样一个结构因果模型(SCM)并生成观测数据,再配一段设定在真实领域的合成自然语言故事;可选地用真实数据的经验分布做锚定,以降低「causal parrot」(背因果套话)风险。任务覆盖 Pearl 因果之梯的全部三层,通常带编码环节和多工具调用(因为观测常不完美);尤其把「问题无有效答案时恰当地弃答」作为一等被评分的结果。摘要未给逐模型成绩。

优点:把符号因果、数据科学、不确定性量化、弃答、工具/编码统一进一套基准,覆盖面广;用合成 SCM 系统化造题,避开模板化与数据泄漏;把「弃答」显式计分,贴合真实分析中的「无解」情形;对数据科学 Agent 的评测缺口有针对性。 缺点:摘要无模型对比数字,难判当前系统水位;合成故事与真实数据分析任务之间仍有分布差;「弃答」判定的评分口径需细看全文;纯基准、无新方法。

Harness / 工程实践

Remember When It Matters — Proactive Memory Agent for Long-Horizon Agents

核心动机:长程任务里关键信息散落在越来越长的轨迹中,会被埋没、甚至被挤出上下文窗口;作者把这种失败模式命名为「behavioral state decay」——相关事实在真正需要时无法影响决策。这是典型的 agent 运行时上下文/记忆管理问题,故归入 harness / 工程实践。

横向对比:方案是让一个独立的 memory agent 与「不做改动」的 action agent 并行运行——它从近期轨迹维护一个结构化 memory bank,并决定是注入一条「有记忆依据的提醒」还是保持沉默;作者刻意把记忆定位为主动干预机制而非被动检索,且强调该模块即插即用于前沿 action agent 与现有 agent harness。效果上 Terminal-Bench 2.0 +8.3pp、τ²-Bench +6.8pp(对偏弱与偏强的 action agent 都涨);消融显示「选择性干预」优于被动 bank 暴露、always-on 注入、仅给建议、以及通用检索四种对照;此外还用 SETA 以 SFT + GRPO 训了 Qwen3.5-27B,验证奖励提升,但对 Terminal-Bench 只有「部分迁移」。

优点:把「记忆」从被动检索重构成「该提醒才提醒」的选择性主动干预,是漂亮的 harness 层洞察;不改 action agent、即插即用;在真实 agent 基准上有明确正增益(+6~8pp);消融充分,证明选择性注入确实优于各种朴素基线。 缺点:训练出的开放权重记忆策略仅「部分迁移」,泛化有限;额外的 memory agent 带来算力与延迟开销;仅在两个 agent 基准上验证;「注入时机误判」的代价(打断/误导)未量化。

Eval / 评测

UI2App — Benchmarking Visual Interaction Inference in Executable Web Application Generation

核心动机:现有前端产物评测大多只看「长得像不像」(视觉保真),缺对「点不点得动」(交互能力)的系统评测。UI2App 把问题推到极端——只给静态截图、不给文字或行为说明,让模型从视觉线索反推应用应有的交互(首个针对「interaction inference」的基准)。

横向对比:327 张截图、45 组状态连贯集合,对应可运行的多路由 web 应用;四维打分——可执行性、导航可达性、视觉保真、交互推断(IIS),其中 IIS 按功能正确性 + 状态管理复杂度给分,认「任一有效实现」而非匹配单一参考。6 个前沿 VLM 上,视觉保真第一的模型 IIS 仅 7.5、总排名掉到第四,落后 IIS 冠军 5.2 倍;高复杂度交互(如跨页状态)上半数模型直接得 0——「视觉重建」与「交互实现」严重错配。

一句总结:给前端/webapp 产物评测立起「交互正确」这根独立标尺,方法学上可直接借鉴(IIS 的「认任一有效实现」尤其贴 JS/TS 现实)。本篇 7 月 7 日提交,略早于本期窗口,作为 Eval 子类补录;更完整的前端产物评测谱系见专题《前端 / WebApp 产物的 Eval 现状》

世界模型与具身

ARDY — Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

核心动机:交互式人体动作生成卡在一道鸿沟——离线方法控制精准却太慢、无法实时交互;在线方法能实时,却牺牲可控性、也难处理复杂文本语义与长程目标。ARDY 想同时要「实时」和「可控」。落点在实时流式控制与人形机器人,故收入具身线。

横向对比:ARDY 是一套流式生成框架,用混合表征(显式 root 特征 + 隐式 body embedding),配一个带可变历史上下文的两阶段自回归 transformer 去噪器,支持在灵活的长程运动学约束下条件生成;在大规模动捕数据上训练,可在线文本提示、鼠标/键盘驱动 locomotion、路径跟随与关键帧约束。在 HumanML3D 与自建的大规模高保真 Bones Rigplay 数据集上评测(摘要未给 FID 等具体数值)。

优点:把「离线可控」与「在线实时」缝到一起,交互体验是核心卖点;流式 + 可变历史上下文天然适合实时驱动;面向动画、仿真与人形机器人的具身控制,NVIDIA 开放了项目页、代码与模型;两阶段自回归去噪的设计清晰。 缺点:摘要缺定量指标,画质/时序难与同类横比;偏图形学动作生成,迁到真实机器人控制时的物理可行性待验证;依赖动捕与 ground-truth 姿态提供约束;长程自回归漂移与风格泛化未见专门证据。