本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。

本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 15 日至 20 日:产品线上唯一落在窗内的一手前沿发布是 Moonshot 于 7 月 16 日转正的 Kimi K3(此前传闻目标 7 月 17 日的 Gemini 3.5 Pro 仍是「coming soon」,未上线,本期不收);论文这批 UTC 提交时间集中在 7 月 14 至 17 日,正好接上上一期(只收到 7 月 13 日提交)之后的空档。本期一个显著的共同主题是 agent harness(智能体运行时脚手架)——同一周里既有人教它「怎么改得动」,也有人质疑它「到底有没有用」,故 Harness 与 Eval 两条线本期都偏厚。

模型 & 产品

Kimi K3(Moonshot 旗舰,首个开放 3T 级模型)

Moonshot 于 7 月 16 日发布 Kimi K3,自我定位为「迄今最强模型」与「全球首个开放的 3T 级模型」,主打编码、知识工作与推理三条能力线。它不是一次营销式的小版本,而是把参数量与训练效率同时往上抬了一档。

  • 模型本体:2.8 万亿总参的 MoE,走 Stable LatentMoE 框架、每 token 从 896 个专家里激活 16 个;底层换用了 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)两项设计,官方口径是整体扩展效率较 Kimi K2 约提升 2.5 倍。原生带视觉能力,上下文窗口 100 万 token。
  • 性能(官方口径):Moonshot 直言整体仍落后于最强的闭源模型 Claude Fable 5 与 GPT 5.6 Sol,但称在其余受测模型(GLM-5.2、Claude Opus 4.8、GPT 5.5 等)之上稳定领先。给到具体数字的两项:DeepSWE 在 mini-SWE-agent 脚手架下拿到 67.3;BrowseComp 在 100 万 token 上下文、不做任何上下文管理的条件下拿到 90.4。此外它自建了一个 Triton 风格的编译器 MiniTriton,官方称在 kernel 优化上与 Fable 5 相当、明显好于 Opus 4.8 / GPT 5.6 Sol / GPT 5.5,并演示了在一次 48 小时自主运行里设计出一块 4 mm²、100 MHz 的芯片。
  • 接入与开放:API 模型名 kimi-k3,默认开到最大思考强度;定价为缓存命中输入 $0.30/MTok、缓存未命中输入 $3.00/MTok、输出 $15.00/MTok,官方称编码负载下缓存命中率可超 90%。完整权重计划于 7 月 27 日放出,届时才真正兑现「开放」二字。
  • 局限:官方自陈对「思考历史」较敏感、存在「过度主动」的问题,且整体用户体验与 Claude Fable 5 / GPT 5.6 Sol 仍有肉眼可见的差距。把它理解成「开放阵营把参数与 agentic 能力推到 3T 级」的一步,而非全面超越闭源,更准确。

论文精选

每篇附 arxiv / 项目链接,并给出「实用性 / 创新性」评分(满分 5)。本批预印本 UTC 提交时间集中在 7 月 14 至 17 日,部分定量结论以摘要口径为准,细节以全文为准。

LLM / Agent

SEED — 智能体强化学习的自演化在线蒸馏

核心动机:越来越多的 LLM 被当作智能体、拿去做长程任务,而基于最终结果的 RL 奖励极其稀疏——回合级的成败与 token 级的策略更新之间隔着一道「监督鸿沟」,模型学得慢也学不稳。

横向对比:SEED(Self-Evolving On-Policy Distillation)的做法是把跑完的在线轨迹回炼成「训练期事后技能」(hindsight skills)——先微调策略去用自然语言总结出可复用的工作流、决定性的关键观察、以及规避失败的规则;RL 阶段里,同一个策略模型既采集轨迹、又充当分析器抽取这些事后技能,然后把「普通上下文」与「加了技能的上下文」下对同一批动作的打分之差,转成一个稠密的 token 级在线蒸馏信号,与结果导向的 RL 联合优化。作者称在文本与视觉两类智能体任务上都能稳定提升表现与样本效率,并能泛化到未见场景;摘要未给具体分数。

优点:把「稀疏结果奖励 → 稠密 token 级信号」这条转化路径讲清楚了,且信号来自模型自己的轨迹、不依赖外部教师;技能以自然语言承载,天然可读、可复用;同时覆盖文本与视觉智能体,泛化面较宽;已开源。 缺点:摘要无定量 benchmark 数字,难判增益幅度;「同一模型既采集又分析」可能带来自我确认偏差,坏轨迹总结出的坏技能会被回灌;多一条技能抽取与再打分链路,训练工程复杂度上升;对技能质量的依赖没有充分消融。

Understanding Reasoning — 从预训练到后训练看推理能力的来路

核心动机:RL 后训练与预训练在推理任务上到底怎么互动,业界一直说不清两个问题——预训练的选择(模型规模、数据量)如何改变「RL 算力的边际收益」,以及 RL 究竟对模型做了什么。

横向对比:作者用国际象棋当受控试验台,走一条标准流水线:在人类棋局上预训练 5M 到 1B 的模型,用合成推理轨迹做 SFT,再在带可验证奖励的残局题上做 RL。几条结论很干净:给定 RL 算力下的最终表现,可以由预训练 loss 很好地预测;RL 奖励曲线的斜率随预训练 token 数近似线性变陡;RL 不只是把 SFT 策略「磨锋利」——简单题上它放大 SFT 本就偏好的正确着法,难题上它能把 SFT 下几乎不出现的正确着法「捞出来」。这些发现随后在一个 1B 的数学领域模型上复现:预训练越久的 checkpoint,后训练表现越高、在 RL 下涨得也越快。

优点:用可完全控制、可验证奖励的棋类环境,把「预训练→RL」的因果关系做成了可测量的科学结论,比在开放任务上刷分更能说明机理;「预训练 loss 预测后训练表现」「预训练越久 RL 越受益」对训练资源分配有直接指导意义;难/易题上 RL 行为不同这一观察,纠正了「RL 只是锐化分布」的流行说法。 缺点:象棋与合成轨迹是高度受控的设定,向自然语言推理的外推需谨慎;最大只到 1B,超大模型是否同律未验证;「可验证奖励」在真实任务里往往不可得,结论的适用边界受限。

When Does Muon Help Agentic RL? — Muon 优化器在智能体 RL 里到底帮不帮忙

核心动机:Muon 优化器在大规模预训练里已被证明能与 AdamW 掰手腕,但它对 RL 后训练——尤其是智能体式 RL——有没有价值,此前是个空白。

横向对比:作者在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做单种子对比。给到的数字很直接:在 GiGPO(Group-in-Group Policy Optimization)下,只把 Muon 用在隐藏层权重矩阵上,就把最终窗口的验证成功率从 0.290 抬到 0.546(+88%);在学习率 3e-5 下,Muon 把 GRPO 从 0.161 提到 0.268;总体收益强烈依赖于所用的 advantage estimator 与学习率,某些配置下还能更早若干次更新就跨过 0.5 / 0.75 的成功率门槛。作者把这些明确标注为探索性结果,多种子与跨任务验证仍待补。

优点:填了「Muon 在智能体 RL 上有没有用」这个具体空白,且给的是可复算的成功率与学习率区间,工程上能直接照着试;「只在隐藏权重矩阵上用 Muon」是个低成本、可插拔的改法;点明收益吊在 advantage estimator 与学习率上,避免了「换个优化器就万能」的误导。 缺点:单种子、单一小模型(0.5B)、单一环境,统计强度弱,+88% 这类数字的可复现性存疑;结论承认自己是探索性的;不同 estimator/学习率下方差极大,说明鲁棒性尚不成熟;能否迁移到大模型与真实 Agent 任务未知。

Harness / 工程实践

Harness Handbook — 让不断演化的智能体脚手架「读得懂、找得到、改得动」

核心动机:一个智能体的能力由底座模型和 harness(负责 prompt 构造、状态管理、工具调用、执行编排的运行时脚手架)共同决定。模型、API、需求一直在变,harness 就得持续改;但改之前要先定位「实现某个行为的所有代码」,而生产级 harness 往往庞大、耦合紧、行为分散在多处——「行为定位」成了真正的瓶颈。

横向对比:Harness Handbook 是一个以行为为中心的表示,通过静态分析 + LLM 辅助结构化,从 harness 代码库里自动合成出来,把「行为」映射回源码位置;配套的 BGPD(Behavior-Guided Progressive Disclosure)引导智能体从高层行为逐级下钻到实现细节,并在过程中校验候选位置对不对。在两个开源 harness 上按真实修改请求测试,Handbook 辅助的规划在定位准确度与编辑方案质量上都有提升,且用的 planner token 更少;提升最明显的正是「散落多处的站点、极少被执行的路径、跨模块交互」这些最难啃的场景。

优点:把「harness 越改越难维护」这个从业者天天遇到、却少被正式研究的痛点挑明并给了方法;用静态分析补 LLM 的定位短板,思路务实;在最难的散落 / 冷路径 / 跨模块场景收益最大,正好切中要害;「更准 + 更省 token」两个方向同时改善。 缺点:只在两个开源 harness 上验证,工业级私有 harness 的规模与耦合度可能是另一量级;自动合成的行为表示本身需要维护,harness 一变它也得跟着更新;LLM 辅助结构化的准确性会随代码库风格波动;摘要未给公开代码链接。

Recursive Harness Self-Improvement — 把 harness 当成可自我迭代的智能体规范

核心动机:在「模型—harness 协同演化」的视角下,harness 其实是个数据生成组件——它跑出来的执行轨迹会喂给未来的底座模型训练。由此引出「harness-in-the-loop 学习」:优化 harness 时既要顾当下的智能体表现,也要顾它产出轨迹的质量。但持续改厂商级脚手架成本高,作者转而研究:只优化用户侧、针对具体任务的 harness,能否在保持轻量的同时把轨迹质量抬上去。

横向对比:RHI(Recursive Harness Self-Improvement)把 harness 看成「智能体循环的 prompt 级规范」,用它自己修订历史里的成对反馈来迭代改写。在横跨量化金融、机器人、药学的 30 个合成 ML 研究任务上,几轮 RHI 就能把「低推理强度」的智能体显著抬升——甚至超过「最大推理强度」的设置,同时把推理成本削减最多 60%。作者把增益主要归因于更好的任务级上下文管理与更顺畅的智能体间信息流动,而非更长的推理轨迹,并给出一个信息论假设来刻画 RHI 隐式的优化目标。

优点:把「改 harness」从人工调参变成有反馈信号的自动迭代,且只动用户侧脚手架、成本可控;「低推理强度 + 好 harness 反超高推理强度、还省 60% 成本」是极有工程说服力的结论,直指「与其加思考预算不如改脚手架」;把增益归因到上下文管理与信息流动而非更长 CoT,纠正了「堆推理」的惯性。 缺点:30 个任务且为合成任务,真实研究场景的泛化未知;「成对反馈来自自身修订历史」存在自我强化偏差风险;信息论解释仍是假设、未经严格验证;对底座模型与任务类型的依赖程度尚不清楚。

Generative Compilation — 边生成代码边给编译器反馈

核心动机:Rust 这类静态语义丰富的语言能给 AI 生成的代码更强保证,但也正因为严格,生成起来更难。标准编译器只能在「生成完」之后给反馈,管不到自回归解码这种中间步骤;而约束解码虽然介入得早,却要求白盒模型访问、且为每条语义约束重写一遍解码逻辑,代价高昂。

横向对比:作者提出「生成式编译」——首个在生成过程中就对「部分程序」拿到编译器反馈的方法。核心是一个 sealor:一个轻量、基本靠语法引导的变换,把不完整的程序补成「完整、能被标准编译器诊断」的形态;它保证「有可能补全的部分程序」永远不会被误杀,同时能尽早识别出真正的死路。作者在一个 Rust 风格的演算上构造了 sealor 并用 Lean 机械化证明了其性质,再扩展成首个面向真实 Rust 的部分程序检查器。在仓库级 Rust 编码任务上、覆盖前沿黑盒与开源模型评测,相比「生成后再反馈」的标准做法,它能减少无法编译的产出、提升功能正确性——因为错误在离源头最近处就被抓住,从而抑制了错误级联、也让诊断更聚焦。

优点:把编译器反馈从「事后」提前到「生成中」,且不需要白盒访问,工程上对任何黑盒/开源模型都可用;用 Lean 证明 sealor 性质,理论保证扎实(不误杀可补全程序);针对 Rust 这类强静态语言、又落在仓库级真实任务上,价值明确;「早抓错、减级联、聚焦诊断」这条因果链讲得清楚。 缺点:摘要未给具体的通过率/正确率数字,增益幅度需看全文;sealor 目前绑定 Rust 语义,迁到其它语言要重做;「基本靠语法引导」意味着对深层语义错误的覆盖有限;生成中反复补全 + 编译会引入额外延迟与开销。

Eval / 评测

AgentCompass — 统一的智能体能力评测基础设施

核心动机:LLM 正大规模变成自主智能体,需要统一的评测基础设施;但现有评测流水线高度碎片化、彼此紧耦合,既伤复现性,又逼着每个人重复造轮子。

横向对比:AgentCompass 是一套开源、轻量、可扩展的智能体评测基建,把评测拆成三个相互独立的组件——Benchmark(基准)、Harness(脚手架)、Environment(环境)——从而能灵活组合配置,而不必每次都重写复杂的执行逻辑;还带一个容错的异步运行时,以及用于诊断「reward-hacking」等失败模式的轨迹分析工具。原生支持 20 多个 benchmark,覆盖五个能力维度。值得注意的是,它把 Harness 显式抽成评测里的一等轴——这与本期几篇「harness 本身该怎么建、怎么评」的工作正好呼应。

优点:直击「评测碎片化、复现难、重复造轮子」的真实工程痛点;Benchmark/Harness/Environment 三段解耦是干净的抽象,换基准或换脚手架不必重写执行逻辑;自带容错异步运行时与失败模式(含 reward-hacking)诊断,对自建 eval 有直接工程价值;开源、原生 20+ 基准,起步成本低。 缺点:本质是工程基建而非新评测科学,创新性偏「整合」而非「发现」;20+ 基准的覆盖是否够代表智能体能力全貌,取决于选型;「五个能力维度」的划分边界需看细节;长期价值取决于社区能否持续贡献适配器。

Rethinking the Evaluation of Harness Evolution — harness 自动演化,真的比简单的 test-time scaling 强吗

核心动机:自动「harness 演化」(用单元测试去搜索 harness 配置,再在同一个公开 benchmark 上报成绩)最近很热,但作者指出这套评测范式有两个隐患:其一,harness 演化本质是一轮轮的迭代搜索,理应在「同等反馈与推理预算」下与简单的任务级搜索基线对比,才能判断收益到底来自更好的 harness 设计、还是仅仅来自多花的搜索;其二,搜索和最终评测共用同一个 benchmark,报出来的增益有过拟合到那套任务上的风险。

横向对比:为此作者在可比预算下,把 harness 演化与 test-time scaling、以及若干 discovery 基线对比,并在留出(held-out)任务上评测泛化。在 Terminal-Bench 2.1 上、用 GPT-5.4 与 Claude Opus 4.6 做实验,结论相当冷静:自动 harness 演化并不能稳定地超过简单的 test-time scaling 方法,且泛化能力有限——这对「harness 自动演化」这一路线的有效性提出了质疑,也点出当前评测协议需要更公平的设计。

优点:在一片「harness 演化涨点」的乐观里做了必要的证伪工作,方法论意识强——「同预算对比 + 留出集泛化」是评测公平性的关键补丁;戳破「同 benchmark 上又搜又测」的过拟合隐患,对整条研究线都有校准价值;用主流强模型(GPT-5.4、Opus 4.6)在 Terminal-Bench 2.1 上验证,说服力足;已开源。 缺点:主要贡献是「泼冷水 + 立协议」,本身不提供更强的 harness 方法;结论绑定 Terminal-Bench 2.1 这一套任务,换域是否同样成立待验证;「简单 test-time scaling」作为基线的实现细节会影响结论强弱;对「什么样的 harness 演化才真正有效」只给了方向、未给答案。

世界模型与具身

BadWAM — 世界-动作模型「想得对却做得错」

核心动机:用于具身控制的世界-动作模型(WAM)把「动作生成」与「未来世界预测」耦在一起,业界普遍相信这种耦合会让模型更鲁棒、更可解释、更安全。作者要挑战的正是这个信念。落点在具身控制的对抗鲁棒性,故收入具身线。

横向对比:BadWAM 是一个统一建模并评估「世界-动作漂移攻击」(World-Action Drift Attacks)的框架——用微小的视觉扰动,去破坏 WAM「想象的未来」与「实际执行的动作」之间的对齐。框架沿攻击强度与隐蔽性两个维度刻画:一种是「只攻动作」的对抗攻击,把模型推向会导致任务失败的动作,在闭环执行下把成功率从 96.5% 打到 43.1%;另一种是「保留想象」的对抗攻击,让有害的动作改变发生的同时,把想象出的未来维持得与干净输入几乎一致——从「明目张胆地劫持动作」一路覆盖到「更隐蔽的想象-动作失步」。

优点:反直觉地证明「想象+动作耦合 ≠ 更安全」,给具身世界模型的安全叙事泼了盆冷水;把攻击沿强度/隐蔽性两轴形式化,且给出 96.5%→43.1% 这样的硬数字,冲击力足;「保留想象却改坏动作」这类隐蔽攻击,暴露了「看模型想得对不对」并不能保证它做得对,对依赖世界预测做可解释性/监控的方案是直接警示。 缺点:是攻击/诊断工作,未给出对应的防御方案;实验设定与被攻击 WAM 的范围以摘要为准,跨模型/跨任务的普适性待看全文;视觉扰动攻击在真实物理部署中的可实现性(相机噪声、光照)需另行验证;未讨论攻击在真实机器人闭环上的可迁移性。