本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。

本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 20 日至 22 日,只有两天,故收得偏精:产品线落在窗内的一手前沿发布是 Google 于 7 月 21 日一次性推出的 Gemini 3.6 Flash 系列(此前在 5 月 I/O 上承诺、原定 6 月的 Gemini 3.5 Pro 仍未上线,本期不收);论文这批 UTC 提交时间集中在 7 月 20 至 21 日,正好接上上一期(收到 7 月 17 日提交)之后的空档。若说上一期的共同主题是「harness 该怎么建、到底有没有用」,那么本期的主题更下沉一层:把智能体运行时的每一环分别抠效率——上下文(SWE-Pruner Pro)、优化器/RL(ISO、SAT、LLM-as-Coach)、部署(FlashRT)、调试(AgentDebugX)。有意思的是 Gemini 3.6 Flash 官方主打的也正是「更少 token、更少推理步与工具调用就完成多步工作流」——这一周工业界与学术界不约而同地在抠 agent 的效率,而非上限。

模型 & 产品

Gemini 3.6 Flash(Google 主力「workhorse」模型)

Google 于 7 月 21 日一次放出三款模型:主力的 Gemini 3.6 Flash、更便宜的 3.5 Flash-Lite,以及面向安全场景的 3.5 Flash Cyber。定位不是冲上限的旗舰,而是把「日常主力档」做得更省——官方口径是同等任务下 token 消耗最多降 17%,并用「更少的推理步数与工具调用完成多步工作流」。

  • 定位与能力:3.6 Flash 主打编码、知识工作与多模态三条线的性价比,知识截止从前代(3.5 Flash)的 2025 年 1 月推进到 2026 年 3 月——这 14 个月的知识更新,对日常使用者的价值可能比某个编码榜上的百分点更实在。3.5 Flash-Lite 是系列里最便宜的一档;3.5 Flash Cyber 是专攻「发现并修补安全漏洞」的特化版,仅通过限量试点向政府与可信合作方开放。
  • 性能(媒体/第三方口径,非官方博客核实):编码上第三方汇总称 DeepSWE 从前代 37% 提到 49%、知识工作 GDPval-AA 从 1349 升到 1421,Frontend Code Arena 从第 21 名升到第 12 名(1537 分);但在 Artificial Analysis 综合智能指数上仅得 50 分,落后于 Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Sonnet 5、Grok 4.5、GPT-5.6 Terra,有测评甚至指出与前代 3.5 Flash 同分。换言之:省钱、编码有肉眼可见的改善,但综合智能没有拉开代差。这些具体数字来自媒体聚合,官方博客页未逐条核实,引用请留余量。
  • 接入与定价:$1.50/MTok 输入、$7.50/MTok 输出(前代输出为 $9/MTok),已在 Google AI Studio、Vertex AI 与 Gemini App 上线,并开始并入 GitHub Copilot。
  • 缺席与预告:本次最值得玩味的是「没发的那个」——5 月 I/O 承诺、原定 6 月的 Gemini 3.5 Pro 至今未广泛上线,官方只说仍在与合作方测试、将「很快」推出,无明确日期。同时 Google 确认已启动迄今最大规模的 Gemini 4 预训练,但未给任何时间线或规格。把这次发布理解成「主力档降本增效 + 为下一代占位」,比理解成「冲榜」更准确。

论文精选

每篇附 arxiv / 项目链接,并给出「实用性 / 创新性」评分(满分 5)。本批预印本 UTC 提交时间集中在 7 月 20 至 21 日,部分定量结论以摘要口径为准,细节以全文为准。

LLM / Agent

SWE-Pruner Pro — 编码智能体「自己知道该裁什么」

核心动机:编码智能体要在多轮里读大量工具输出,长上下文管理是刚需。前代 SWE-Pruner 依赖一个独立的代码分类器来决定裁剪;作者的观察是——agent 在读工具输出时,其自身的内部表征里已经编码了「哪些代码上下文相关」的信号,何必再外挂一个模型。

横向对比:SWE-Pruner Pro 把裁剪动作搬进 agent 内部:一个轻量 head 把模型自己的内部表征映射成「逐行保留 / 裁掉」的决策,并配一个按每段工具输出行数取值的「长度感知 embedding」。在两个开放权重底座、四个多轮 benchmark 上,它最多省下 39% 的 prompt+completion token 而不掉任务质量,额外推理开销有界;在 MiMo-V2-Flash 上还把 SWE-Bench Verified 解决率抬了 +3.8%、Oolong 长上下文准确率抬了 +2.2 分。

优点:不外挂分类器、直接复用 agent 自身信号,零额外模型是干净的省法;逐行决策 + 长度感知 embedding 让裁剪足够细粒度;省 token 的同时还能小涨分,反过来印证被裁掉的确实是噪声而非信息;已开源、绑定主流开放底座,可直接试。 缺点:「自身表征即相关性」的前提是模型本身已训得够好,弱模型未必有可用信号;逐行决策对工具输出的格式较敏感;+3.8% / +2.2 分的绝对增益不大,主价值在省 token;只在开放权重上验证,闭源黑盒模型拿不到内部表征、无法照搬。

LLM-as-a-Coach — 把评委变成教练,给不可验证任务补稠密反馈

核心动机:面向开放式任务做 RL 时,rubric(评分细则)式评估最终被压成一个标量奖励——文字反馈被丢弃,质量本不相同的回答也被混为一谈。作者要把这条被压扁的反馈带宽重新拉开。

横向对比:他们提出「经验式学习」(Experiential Learning, EL),把反馈模型从 LLM-as-a-Judge 升级成 LLM-as-a-Coach:教练把对每条 on-policy 回答的评价,转成可迁移的「经验知识」;这些知识去 condition 一个 teacher 模型,再由策略通过 on-policy 上下文蒸馏吸收。摘要未给具体数字,定性结论是:在两类策略族上(反馈来自策略自身或来自专有模型),EL 都稳定优于 rubric 式 RL,且在分布外泛化更好、reward hacking 更少。

优点:直指「标量奖励丢信息」这一开放任务 RL 的结构性痛点,把文字反馈保留成可迁移经验;走上下文蒸馏而非改奖励函数,工程上能接在现有 RL 流水线之后;号称能减少 reward hacking,对没有硬标准的开放任务尤其值钱;两种反馈来源都成立,说明方法不强绑某个特定 judge。 缺点:摘要通篇无定量数字,「consistently outperform」难以独立核验;「经验知识」的质量取决于 coach 模型,弱 coach 可能沉淀出误导性经验并被回灌;on-policy 上下文蒸馏引入额外的 teacher 与蒸馏开销;不可验证任务本就缺金标准,增益的评估边界模糊。

ISO — RLVR 的「谱继承」:固定权重谱、只优化 frame

核心动机:带可验证奖励的强化学习(RLVR)在提升推理,但「把奖励反馈变成权重更新」的那一层一直没被讲清,作者称之为 RLVR「缺失的优化层」。他们从权重的奇异结构切入,发现一个现象叫「谱继承」(spectral inheritance)——RLVR 基本沿用了底座模型的权重奇异谱,新行为主要来自输入/输出奇异 frame(基向量)的变化,而非谱本身。

横向对比:由此提出「等谱优化」(Isospectral Optimization, ISO),一个固定谱的优化框架,两种形态:ISO-Merger(离线)把共享底座的多个专家模型的 frame 变化合并成一个固定谱模型,号称无需任何合并后数据、rollout、梯度更新或 on-policy 蒸馏;ISO-Optimizer(在线)在保持底座谱不变的前提下,用 AdamW / Muon 等基础优化器只更新 frame 变量。一句话原则是「继承谱、优化 frame」。结果:ISO-Merger 在无数据合并方法里聚合表现最强;在 1.5B–8B 的推理与编码任务上,Qwen3-8B-Base 用标准 AdamW 跑 270 步到 0.495 聚合准确率,ISO-AdamW 只用 100 步就到 0.495、210 步升到 0.509。

优点:给 RLVR 提供了一个可解释的机理视角(谱继承),不是纯 empirical 调法;ISO-Merger 完全 data-free、不需 rollout 与梯度,合并成本极低;ISO-Optimizer 收敛更快(100 步 vs 270 步到同分)有实测支撑;覆盖 1.5B–8B 多个尺度。 缺点:只在 Qwen3 系与 8B 以内验证,超大模型的谱结构是否服从同一规律未知;「谱不变」是个强约束,可能限制模型学到需要改谱的新能力;0.495→0.509 的绝对增益有限;对不同任务与不同 RL 算法的鲁棒性仍待补充。

SAT(Stale but Stable)— 用 staleness 自适应信赖域稳住异步 RL

核心动机:异步 RL 靠把「轨迹采集」和「优化」解耦来提吞吐,但这会引入 staleness(陈旧性)——策略滞后、引擎延迟、MoE 路由都会让用来更新的轨迹「过时」。从信赖域视角看,训练-推理的不匹配是近似误差的来源,而标准 PPO 的 clip 只是一个「采样代理」而非对整策略的约束,导致最需要控制的高 staleness 更新反而被管得最松。

横向对比:SAT(Staleness-Adaptive Trust Region)用「脱离梯度的采样 log-ratio」当 staleness 代理,通过基于 staleness 的核缩放识别出每个 batch 内高失配的尾部样本,然后只收紧名义 PPO 区间里符号选定的那个端点——正常 token 上保持基线行为,只对异常「外侧带」施加更严的更新;并给出相对 PPO 的局部区间包含性与逐点悲观性的理论保证。实验用 Qwen3-30B-A3B-Base,SGLang 推理 + Megatron 训练,AIME24 avg@8:SAT-GSPO 配 R3 最好,lag 1 下 35.83、lag 8 下仍有 34.79;纯 SAT-GSPO 在 lag 1 下 34.17。

优点:把异步 RL 的 staleness 从「凭经验调 clip」上升为有理论保证的信赖域方法;只收紧异常尾端、不动正常 token,改动像外科手术、可插进 PPO/GSPO;给出 lag 1 vs lag 8 的对照(34.79 仍贴近 35.83),实打实证明「延迟大也稳」;在 30B MoE + 主流训练/推理栈上验证,工程可信度高。 缺点:增益幅度温和(35 分量级),主卖点是稳定性而非拉高上限;只在 AIME24 单一评测、Qwen3-30B 单一模型上给数;staleness 代理用采样 log-ratio 是近似,极端路由漂移下是否够用待验;28 页方法偏重,落地需要吃透信赖域细节。

Harness / 工程实践

AgentDebugX — 智能体失败的可观测、归因与恢复工具箱

核心动机:调试 LLM 智能体之所以难,是因为「错误暴露出来的那一步,往往不是真正惹祸的那一步」。现有可观测工具能回放轨迹,却几乎不帮你定位根因,更不会把「诊断」变成「修复」。

横向对比:AgentDebugX 把调试建成一个闭环——检测(Detect)→ 归因(Attribute)→ 恢复(Recover)→ 重跑(Rerun)。核心组件 DeepDebug 做多轮根因诊断:全局轨迹理解 + 结构引导的排查 + 交叉验证。工具以 Python 库、CLI、Web 控制台、可安装的 agentic skill 四种形态交付,还带一个可选的「Error Hub」,把脱敏后的「失败-诊断-修复」包共享成可复用的调试记忆。数字上:在 Who and When 归因基准上,两个开放底座都拿到最好的严格归因精度——qwen3.5-9b 上达到 28.8% 的「智能体+步骤」精确命中,对比最强单遍基线的 21.7%;在 GAIA 上,一次重跑就修好了 73 个失败任务里的 13 个(三个解耦式自我纠错基线只修 4–6 个),把整体准确率从 55.8% 抬到 63.6%。

优点:把「错误暴露点 ≠ 根因点」这一 agent 调试的核心难点点破,并给出闭环而非只做轨迹回放;四态闭环 + 四种交付形态(库/CLI/控制台/skill),落地性强;用「归因精度」和「修好了多少失败任务」双指标验证,比只报 resolve rate 更贴近调试现场;Error Hub 把修复经验沉淀成可复用记忆,方向有想象力。 缺点:28.8% 的绝对归因精度仍偏低,说明根因定位远未被解决;GAIA 上 73 个失败只修好 13 个,覆盖有限;Error Hub 的共享经验需要清洗与质量把关,规模化后有噪声回灌风险;跨底座一致性、以及对超长轨迹的成本未充分展开。

FlashRT — 把参考实现抬成多 GPU 实时部署的 agent harness

核心动机:实时多模态应用(语音智能体、交互式视频生成等)把多个模型串成流水线,要部署得高效,就得针对具体应用做放置、流式、并行的取舍。现有系统只支持有限的变换、且假设固定负载,结果是每来一个新应用就得手写一版优化实现。

横向对比:FlashRT 是一个「引导编码智能体把开发者随手写的参考实现,抬成优化后的多 GPU 部署」的 harness,走「chain-of-program」范式、多趟推进:先把参考代码转成一个捕捉数据依赖与持久状态作用域的中间表示(IR),用顺序解释器校验 IR,再跑静态分析找出候选变换,最后在一个「以实测为闸门」的优化循环里迭代实现、验证、benchmark,按延迟/吞吐目标跨硬件预算择优。数字:NVIDIA B200 上最高约 70× 延迟下降、2.8× 吞吐提升;AMD MI355X 上延迟下降峰值持平、吞吐峰值提升抬到 3.6×;Qwen3-Omni 文本转音频推理在 MI355X 上比专家级 vLLM-Omni 实现降低 65% 响应延迟。被测应用含视频世界模型与多模态 LLM。

优点:把「实时多模态服务的手工优化」外包给编码智能体,切中一个真实且高门槛的部署痛点;IR + 顺序解释器校验 + 实测闸门循环,保证 agent 改出来的东西「跑得对且真变快」,不是盲改;给出 70× / 2.8–3.6× / 65% 的硬数字,且跨 NVIDIA/AMD 两个平台;把优化拆成可验证的程序步骤,思路清晰。 缺点:作者自陈 AMD 上更大的增益部分来自其 baseline 本身优化不足,跨平台数字不能直接横比;70× 是「up to」峰值,常态收益要看全文分布;实测闸门循环需要真机反复 benchmark,优化过程本身耗算力与时间;对参考实现的质量与「可被静态分析」有前提要求。

Eval / 评测

GAMUT — 补齐「事实完整性」评测的两级 meta-rubric 基准

核心动机:以往做事实性(factuality)大多盯着精确率——用「拆解-检索-核验」查每条断言对不对,却几乎不管「回答有没有把该说的都说全」。GAMUT 要补的正是被忽视的另一半:事实完整性。这件事难在你得先枚举出「一个完整回答应包含的全部事实」,而这些事实很少是一张扁平清单——常涉及基于覆盖的开放集合、有序过程、事实间关系,简单的布尔核对根本抓不住。

横向对比:作者提出一个两级 meta-rubric 框架:先用结构化的 meta-rubric 编码「需要哪些内容、各自多重要、怎么组织」,再把它机械地编译成一张二元、机器可判的扁平 checklist,交给 LLM judge 稳定打分。落地为 GAMUT(Grounded Assessment of Multimodal Factuality):1813 道题,锚定在真实可穿戴设备影像上、横跨 10 个领域,每题都配一份由专家标注核验、有证据支撑的 rubric;同时放出一个纯文本变体(框架与模态无关)。在 14 个前沿与开放权重模型上评测,最好成绩只有 58.7%(Gemini 3.1 Pro),且区分度高、对 judge 选择鲁棒。

优点:把 factuality 从「查错」扩到「查漏」,补的是被长期忽视的完整性维度,选题有价值;「两级 meta-rubric → 机器可判 checklist」的编译路径,兼顾结构表达与打分可靠性;1813 题 + 专家核验 rubric + 多模态/纯文本双版本,工程扎实;SOTA 仅 58.7% 说明基准没被刷爆、区分度足;号称对 judge 选择鲁棒,缓解了 LLM-judge 脆弱的顾虑。 缺点:完整性评测要枚举「应含的全部事实」,rubric 的完备性本身依赖标注者判断,天花板受限;grounding 在可穿戴影像这一特定场景,向通用问答外推需谨慎;「机械编译」出的 checklist 能否覆盖有序过程与关系型事实,摘要未细说;58.7% 的 SOTA 是 Gemini 3.1 Pro,与更新模型的差距未完整列出。

世界模型与具身

AlayaWorld — 15B 交互式长程世界模型,蒸馏到每 chunk 4 步

核心动机:传统游戏开发依赖资产、动画、物理、代码的重人工流水线;视频世界模型则能直接从文本/图像/视频输入里生成可交互、可探索的环境。作者认为要兑现这个愿景,得同时具备四种耦合能力:交互、持久的时空一致性、稳定的长程生成、以及高效响应。落点在「交互式世界环境」,故收入本线。

横向对比:AlayaWorld 是一个交互式长程视频世界模型,产出 24fps、540p/720p 的视频;底座是一个 15B 的视频扩散 transformer,自回归地生成短 latent chunk,由相机轨迹与可切换的文本 prompt 引导。为控长程漂移,它用一段「有界视觉上下文」——持久的 sink 帧 + 压缩的时间历史 + 几何对齐的空间记忆 + 近帧条件;并在自身 roll-out 采到的「被破坏历史 + 预测残差」上训练来抗漂移。此外提出一种离散自回归蒸馏,融合分布匹配蒸馏、self-forcing++ 与一致性蒸馏,把推理从约 30 个采样步压到每 chunk 4 步。在 iWorld-Bench 上称在长程生成上取得最好表现(未给具体分数),并强调这是一个全栈、开源、长期的项目。

优点:把「世界模型即交互环境」落到 24fps、540–720p 的可玩级实时,四能力(交互/时空一致/长程稳定/高效响应)拆解清晰;有界视觉上下文(sink 帧 + 压缩历史 + 几何对齐空间记忆)专门针对长程漂移,务实;用自身 roll-out 的被破坏历史 + 残差来训练抗漂移,是个闭环好思路;4 步/chunk 的蒸馏直击实时性瓶颈;开源。 缺点:iWorld-Bench 上只给「最好」的定性说法、无具体分数,难以横比;以视频为载体的世界模型,长程的物理一致性与因果正确性仍是老大难,摘要未量化;15B + 扩散 transformer 的真实时延与显存门槛未交代;作为「长期项目」,当前完成度与可玩范围需看全文与 demo。