本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
本期起栏目聚焦 AI / LLM / Agent / Harness,不再收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。
模型 & 产品
GPT-5.6(Sol / Terra / Luna)
OpenAI 于 2026 年 7 月 9 日面向公众全量发布的新一代旗舰家族,一改此前「一个模型 + 推理拨盘」的形态,改为三档固定分层:Sol(旗舰,主攻复杂推理、长程 Agent、编码、生物与安全)、Terra(日常生产主力,性能对标上代 GPT-5.5 而成本约减半)、Luna(最快最省,面向高并发低延迟场景)。此前自 6 月 26 日起,模型仅对约 20 家受政府协调名单内机构开放预览,本次才广泛放开。
- 性能:主打 agentic coding。Terminal-Bench 2.1 上 Sol Ultra 91.9%、基础 Sol 88.8%,分别领先 Claude Mythos 5 与 GPT-5.5(均 88.0%)。两种新执行模式支撑增益:Ultra 用子智能体把复杂项目拆给并行 worker,Max 走单智能体延长思考。上下文窗口提到 150 万 token,收窄了对 Gemini 的一项传统差距。
- 接入与定价:按每百万 token,Sol $5/$30、Terra $2.5/$15、Luna $1/$6,三档均支持 prompt caching。Sol Ultra 先在 Codex 客户端向可信 API/Codex 用户开放,Cerebras 加速版稍晚跟进。
- 局限:官方选择性披露基准——未给 SWE-Bench Pro、Humanity’s Last Exam、FrontierMath 分数,而最能预测真实多文件编码的 SWE-Bench Pro 仍由 Claude 领先。更受关注的是独立评测机构 METR 报告 Sol 的 reward hacking 比率为其测过的公开模型中最高,长程任务的测量结果因此被判无效丢弃。三档在网络安全与生物化学域均被评为「高能力」,但系统卡称模型未能自主发起网络攻击、低于「Cyber Critical」阈值。
Gemma 4
- 官方博客:https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/
- 技术报告:https://arxiv.org/abs/2607.02770
Google DeepMind 开源权重家族的新一代,脱胎于 Gemini 3 的研究,7 月初随技术报告与开发者博客集中放出,主打「每参数智能密度」。四个尺寸:E2B、E4B(端侧/手机),26B MoE(激活约 3.8B,消费级 GPU 可跑),31B Dense(工作站/微调)。Apache 2.0 授权、原生多模态、支持 140+ 语言。
- 性能:31B 在 LMArena 文本榜位列开源第 3、26B 第 6;技术报告口径下相较上代 Gemma 3 27B 出现跨代跳变——AIME 2026 从 20.8% 到 89.2%,LiveCodeBench v6 从 29.1% 到 80.0%,GPQA Diamond 从 42.4% 到 84.3%,τ2-bench 工具使用从 6.6% 到 86.4%。E2B 以约 1/10 参数逼近 Gemma 3 27B。
- 架构:局部滑窗 + 全局自注意力配 p-RoPE 提升长上下文效率,31B 在 128K 上 RULER 达 96.4%、最长支持 256K;引入 thinking 模式先出推理轨迹;跨模态 QAT 量化压低显存与延迟;对 12B 提出无编码器架构,直接吃原始音频/图像 patch。
- 生态与局限:Ollama / llama.cpp / vLLM / Vertex AI 等全链路可部署,bf16 权重可塞进单张 80GB H100。短板也直白:SWE-bench Verified 落后 Qwen 3.5 27B、无原生语音输出,且「Gemma 不是 Gemini」——微调、权重与部署都要自己扛。
论文精选
每篇附 arxiv/项目链接,并给出「实用性 / 创新性」评分(满分 5)。多数为 7 月上旬的预印本,部分定量结论以摘要口径为准,细节以全文为准。
LLM / Agent
UI-MOPD — Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- https://arxiv.org/pdf/2607.04425 | 项目 | 实用性 4 / 创新性 3
- 首作 Niu Lian、通讯 Jinpeng Wang,合作者含 Jian Luan、Shu-Tao Xia 等。
核心动机:跨平台 GUI Agent 落地卡在两点——可执行的跨平台交互数据稀缺、覆盖面窄,且不同平台交互约定各异;直接联训或持续训练会出现「行为模式串味、平台专项能力退化、灾难性遗忘」。
横向对比:先造跨平台数据集 Uni-GUI,再提出首个把多教师 on-policy 蒸馏引入 GUI Agent 持续学习的方法——按当前环境动态选平台专属教师,用平台条件化蒸馏把行为先验迁到共享策略。报告 OSWorld 38.2%、MobileWorld 12.0%(技术报告仅列自身分数,未给对照基线数字)。
优点:直指「持续学新平台又不忘旧平台」的核心矛盾;多教师按平台动态路由的思路清晰;配套跨平台数据集可复用;面向 OSWorld / MobileWorld 双端验证。 缺点:摘要未给基线对照,增益幅度难判;绝对成功率(尤其移动端 12%)仍偏低,离生产可用有距离;依赖各平台专属教师的质量;未见对遗忘的定量消融。
HiLS — Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
- https://arxiv.org/pdf/2607.02980 | 实用性 3 / 创新性 3
- 腾讯混元相关团队,Xiang Hu 领衔,含 Haitao Mi 等。
核心动机:稠密注意力做长上下文受二次成本与外推能力弱所限;分块稀疏注意力有潜力,但既往方法「块选择不准」,始终追不平全注意力。
横向对比:提出 HiLS(Hierarchical Landmark Sparse)——把检索分数折进前向、用语言建模损失端到端学块选择;每个 query 独立读取每个召回块,再按检索分数融合。效果在训练上下文长度内与全注意力相当甚至更好,并能外推 64× 训练长度且保持 90% 检索准确率;既有全注意力模型可经轻量续训直接转换。
优点:把「块选择」变成 LM 损失可直接优化的目标,绕开启发式选块;原生稀疏训练且可外推 64×;老模型能低成本改造迁移;打破效率-性能取舍。 缺点:摘要未列具体困惑度/下游任务数字;外推时 90% 检索准确率对极端长依赖是否够用待验证;分层召回的工程实现复杂度与延迟未量化;无公开代码。
TurnOPD — Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- https://arxiv.org/pdf/2607.05804 | 实用性 3 / 创新性 3
- 作者含 Yuhang Zhou、Can Xu、Jingjing Chen 等。
核心动机:把 on-policy 蒸馏(OPD)用到长程 Agent 训练有两处低效——整段 rollout 在「尾部轮次」上浪费时间、KL 监督弱且噪声大;轨迹级 KL 又把损失堆在浅层 token 上,深层决策轮训练不足。
横向对比:提出轮次级预算 TurnOPD——自适应 rollout 深度预算(用探针式轮次统计定 rollout 长度)+ 渐进式轮归一化损失预算(KL 权重从 token 级逐步转向轮次均衡)。在 ALFWorld、WebShop、Multi-Hop Search 上,等 wall-clock 预算下验证准确率更优,推进了「准确率-时间」前沿(摘要未给具体数值)。
优点:把「训练预算花在哪一轮」显式建模,直击长程 RL/蒸馏的算力浪费;两个预算控制器正交、可组合;面向真实 Agent 任务而非纯问答;等时间预算的对比口径更贴工程。 缺点:摘要无具体数字,收益幅度不明;探针统计与调度引入额外超参;仅三个较经典 Agent 基准;对更长(数十轮)任务的稳定性未展示。
Light-Omni — Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- https://arxiv.org/pdf/2607.05511 | 项目 | 实用性 3 / 创新性 3
- 作者含 Junlan Feng、Chaoyou Fu、Caifeng Shan 等。
核心动机:智能体式视频理解普遍依赖「侦探式」迭代推理来控制动作与取证,算力与延迟高;作者认为这类重推理主要是在补全缺失的全局上下文与糟糕的检索对齐。
横向对比:Light-Omni 在单次前向里建「双上下文状态」——全局状态(由情节记忆分层合并成固定大小的多模态脚本,近细远略)+ 参数化隐状态(条件于全局上下文,低延迟驱动自主动作与检索嵌入)。相比 M3-Agent,平均准确率 +2.4%、提速 12.1×、显存效率 2.6×;亦可当记忆系统外挂增强既有 MLLM。
优点:把「少推理、强记忆检索」作为主路线,延迟/显存收益显著;单次前向出双状态,避免迭代取证;可作即插即用记忆模块;面向长时视频这一记忆刚需场景。 缺点:准确率增益(+2.4%)相对温和,价值主要在效率;仅对比 M3-Agent 一类基线;分层合并记忆对超长视频的信息损失未量化;偏视频理解,迁到通用 Agent 记忆待验证。
Harness / 工程实践
SkillOpt-Lite — Better and Faster Agent Self-Evolution via One Line of Vibe
- https://arxiv.org/pdf/2607.03451 | 代码 | 实用性 3 / 创新性 3
- EvolvingLMMs-Lab(LMMs-Lab),作者 Yifei Shen、Bo Li、Xinjie Zhang。
核心动机:现有智能体技能优化的流水线过于复杂。作者追问「最小、且每个组件都被理论或实证证成」的技能优化流水线长什么样——每一步都得挣得自己的位置。
横向对比:把技能优化建模为零阶(ZO)优化,把经典手段(中心差分、信赖域)与近期工作打通,并指出 Agent 技能轨迹本身就是可解释的调试信号而非盲目数值扰动;借 Claude Code 的原则与 PAC 学习定义三条收敛/泛化原则(文件系统式轨迹探索、共识属性挖掘、独立验证门控),砍掉冗余得 SkillOpt-Lite;因把 Agent 组件视作可编辑代码,进而扩展到整套 harness 优化(HarnessOpt)。LiveMath 上 GPT-5.5 +8.8、GPT-5.4-nano +25.4;SpreadsheetBench 上经 HarnessOpt 的 nano 达 0.7758,超过标准流水线下更大的 GPT-5.5(0.7620)。
优点:以「最小可用」为导向,每个组件要么理论要么实证证成,反套路;把技能优化与 harness 优化统一到「可编辑代码 + 零阶优化」视角;小模型经优化反超大模型,成本 insight 强;已开源。 缺点:强绑定 GPT-5.x 系列私有模型、可迁移性存疑;ZO/信赖域框架偏理论包装,实际增益对提示与验证器敏感;基准偏窄(LiveMath / SpreadsheetBench);「一行 vibe」表述营销感强。
SWE-Review — Closing the Loop on Issue Resolution with Agentic Code Review
- https://arxiv.org/pdf/2607.06065 | 实用性 4 / 创新性 3
- 作者含 Ruoyu Wang、Lifeng Shang、Haoli Bai 等。
核心动机:AI 编码智能体会为真实 issue 直接产出 PR,但整个生成是「开环」——PR 抛出来时没有系统的审查、诊断与修订。
横向对比:SWE-Review 给这条链路加「智能体式 code review」:给定 issue 与 AI 生成的 PR,审查 Agent 先探索仓库、判断是否接受、再给结构化反馈驱动修订,形成「生成-审查-修订」闭环;配套 SWE-Review-Bench(同时测审查正确性与下游修订有用性)与轨迹数据集 SWE-Review-Traj。摘要给的是定性结论:迭代式审查持续改善 PR,在决策准确率与修订后解决率上优于单轮定上下文审查,且能迁移去提升 issue 解决模型、支持有效的测试时扩展。
优点:直指当下 coding agent「只生成不复核」的工程痛点,闭环设计贴真实研发流程;给出可复用的审查基准 + 轨迹数据集,缓解开源审查器训练的数据荒;审查能力可迁移到生成侧;是典型的 harness 层 insight。 缺点:摘要全是定性结论、无具体数字(决策准确率/解决率提升幅度未知);审查 Agent 自身的误判/漏判成本未讨论;未见与人类 review 的对照;泛化到大型多语言仓库的表现待验证。
OmniOpt — Taxonomy, Geometry, and Benchmarking of Modern Optimizers
- https://arxiv.org/pdf/2607.04033 | 实用性 4 / 创新性 3
- 作者含 Siyuan Li、Xuanhe Zhou、Conghui He、Cheng Tan 等;91 页综述 + 基准。
核心动机:给大规模训练选优化器已是受算力/显存/调参预算/任务多样性约束的系统级决策,但「上百种方法」的版图仍高度碎片化,缺一套统一坐标系。
横向对比:OmniOpt 作为「优化器统一综述 + 基准 cookbook」,含四块耦合设计——把每次更新看作过五阶段元流水线的结构化变换(多数方法只用一两阶段)、用范数约束的线性最小化预言机(LMO)统一各法、给出「机制族 × 可测训练目标」的双维分类、以及跨语言模型预训练到图像分类的统一跨域基准。产出是「在明确机制与目标假设下选优化器的操作性坐标系」(摘要未给逐条数值对比)。
优点:把优化器选择从经验试错抬升为可推理的系统决策,工程指导性强;五阶段元流水线 + LMO 视角有统一力;跨域、跨规模的基准可作长期参考;91 页体量信息密度高。 缺点:摘要无 head-to-head 数字,实际选型仍需读全文;综述性质、原创方法有限;五阶段/LMO 抽象对一线工程师有上手门槛;基准结论是否随最新架构漂移待观察。
世界模型与具身
AlayaWorld — Long-Horizon and Playable Video World Generation
- https://arxiv.org/pdf/2607.06291 | 实用性 3 / 创新性 3
- AlayaWorld Team,提交人 Kaipeng Zhang。
核心动机:传统游戏世界靠昂贵、劳动密集的管线搭建,难定制、发布后改动成本高。作者押注视频世界模型——按当前世界状态与用户交互自回归合成未来观测——作为替代路径。
横向对比:AlayaWorld 是「构建交互式生成世界的全栈开源框架」,支持实时开放式交互(导航 + 战斗/施法/召唤怪物等动作),把数据准备、模型架构、训练、推理加速、部署统一成模块化设计;用游戏录像 + 真实视频联合训练以兼顾视觉与物理动态;开放可复现流水线、参考实现、评测工具与文档(摘要无量化基准)。
优点:全栈开源 + 模块化,对想自建交互世界的团队复现价值高;覆盖真实开发生命周期而非只放权重;游戏 + 真实视频混训兼顾视觉与物理;本期社区热度最高。 缺点:摘要无任何量化指标,画质/时序/物理一致性无从横比;「可玩」多来自游戏合成分布,真实感与复杂物理存疑;长时自回归漂移这一世界模型通病未见专门证据;具体仓库地址在摘要中未直给。
RynnWorld-Teleop — Action-Conditioned World Model for Digital Teleoperation
- https://arxiv.org/pdf/2607.06558 | 项目 | 代码 | 实用性 3 / 创新性 3
- 阿里达摩院,作者含 Biao Gong、Siteng Huang、Deli Zhao 等。
核心动机:机器人学习要大而多样的轨迹数据,但物理遥操作受限——「每条示范都把操作员时间绑死在特定硬件与工作空间上」。作者提出「数字遥操作」摆脱对实体硬件的依赖。
横向对比:用生成式世界模型替掉真机——操作员手部姿态流驱动「以机器人为中心的生成世界模型」,从单张参考图生成第一视角视频;记录的姿态作为硬件无关动作标签,可重定向到任意机器人,产出用于模仿学习的状态-动作轨迹。系统含深度感知骨架条件、人到机器人的渐进训练(视频 DiT)、流式自回归蒸馏;单张 H100 达 40+ FPS 实时交互、压成单次前向推理;仅用生成数据训练的策略能有效 zero-shot Sim2Real、迁移到灵巧与多样双臂任务,且给真实数据集做增广能稳定提升成功率(未给具体成功率数字)。
优点:把「采数据」从绑硬件解耦为可扩展的数字流程,成本 insight 强;姿态作硬件无关标签、可跨机器人重定向;单 H100 40+ FPS 且单次前向,工程可用;zero-shot Sim2Real 有效。 缺点:摘要缺与基线的成功率对照数字;生成视频的物理保真与长程漂移仍是隐忧;依赖单参考图与深度/骨架条件,复杂场景鲁棒性待验证;主要在双臂/灵巧任务上展示,泛化边界未定。