本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 13 日至 15 日:这几天没有新的前沿模型发布(GPT-5.6、Grok 4.5、Muse Spark 1.1 都集中在 7 月 8–9 日,Gemini 3.5 Pro 传闻目标 7 月 17 日、尚未上线),产品线只收一条落在窗内、且与栏目「serving 经济学」主题相关的 DeepSeek V4 转正;论文这批于 7 月 14 日在 arXiv 挂出(多数 UTC 提交时间折算到 +08:00 已是 7 月 14 日),正好补上上期(只收到 7 月 10 日提交)没覆盖的 7 月 11–15 日空档。
模型 & 产品
DeepSeek V4(正式版 + 峰/谷分时 API 计价)
DeepSeek 于 7 月中旬把 V4 从 4 月 24 日的 Preview 状态正式转正。放进本栏目,不是因为它是能力跃迁——它不是——而是因为它配套推出了业界首个按时段区分的 API 计价,是一条值得记录的 serving 经济学信号。
- 模型本体:V4 在 4 月已开源两个变体(MIT 许可、HuggingFace 开放权重)——V4-Pro 为 1.6 万亿总参 / 每 token 激活约 490 亿的 MoE,V4-Flash 为 2840 亿总参 / 激活约 130 亿。本次转正官方口径是「在 Preview 基础上做特性与性能优化」,并非新架构,模型 ID 不变。
- 峰/谷计价:这是本次的真正看点——首次引入高峰 / 平峰分时定价,高峰时段(官方给出的时段落在白天工作时段)按平峰的两倍计费。它把「算力供给随时段波动」的成本第一次显式传导给调用方,等于变相引导 Agent / 批处理类负载往夜间迁移。
- 迁移提醒:旧模型名
deepseek-chat/deepseek-reasoner将于 7 月 24 日 15:59 UTC 停用,宽限期内被透明路由到 V4-Flash,之后返回错误——也就是说,无论是否改代码,调用方其实已经跑在 V4 上。 - 定性:把它当作「生产计费与稳定性里程碑」而非能力发布更准确;对以 Token 成本为敏感项的 Agent / harness 场景,分时计价是需要纳入调度考量的新变量。
论文精选
每篇附 arxiv / 项目链接,并给出「实用性 / 创新性」评分(满分 5)。本批均为 7 月 13 日(UTC)提交、7 月 14 日在 arXiv 挂出的预印本,部分定量结论以摘要口径为准,细节以全文为准。
LLM / Agent
MACE — Multi-Agent LLMs Fail to Explore Each Other
- https://arxiv.org/abs/2607.11250 | 代码 | 实用性 3 / 创新性 4
- 作者含 Hyeong Kyu Choi、Xin Eric Wang、Sharon Li(deeplearning-wisc / 威斯康星大学麦迪逊分校一系)。
核心动机:探索(exploration)是多智能体系统可靠自治的底座,但一个基本问题没人系统答过——当 LLM 智能体彼此交互时,它们会主动去「摸清对方能力」吗?作者的结论是:不会。现代智能体表现出短视且极化的交互模式,导致协作差、regret(遗憾值)偏高。
横向对比:论文把这件事形式化为「多智能体探索问题」,建模成一个部分可观测随机博弈(POSG),其中智能体需要通过试探同伴来推断其能力;进而提出 MACE(Multi-Agent Contextual Exploration)——一个轻量框架,用结构化的「同伴选择」显式鼓励探索。实验显示 MACE 在上下文多样性与参数多样性两种设定下都能实质改善探索行为与下游任务表现;理论侧给出一个干净结论:智能体越多样,探索的价值越高。摘要未给具体分数。
优点:把一个真实但没被命名的失败模式(多智能体互相「懒得试探」)挑明并给了名字;POSG 建模清晰;MACE 是轻量、可插到现有多智能体流程的框架;「多样性↑→探索价值↑」有理论支撑。 缺点:摘要无定量 benchmark 数字,难判增益幅度;代码标注为「待发布」;「探索」的操作化定义可能偏窄;在真实 Agent 任务(而非受控博弈)上的普适性未充分验证。
PUST — Proxy Exploration and Reusable Guidance
- https://arxiv.org/abs/2607.11505 | 实用性 3 / 创新性 4
- 作者含 Daocheng Fu、Botian Shi、Yu Qiao 等。
核心动机:后训练(reward 优化、分布匹配那一类)普遍把「策略探索」和「分布对齐」死死绑在一起——探索的算力全压在主模型身上,而且探索出的信号既不能缓存复用、也不能跨模型迁移。
横向对比:PUST(Proxy-guided Update Signal Transfer)把「更新信号的探索」与「对齐」解耦:拿一个轻量 proxy 模型当高效试验台,只把它「初始状态→优化后状态」之间的相对改进信号迁移给主模型,而不是搬运绝对策略分布。这样信号可以异步生成、缓存、复用,且天然支持弱到强(weak-to-strong)与跨模型迁移。在 Qwen3 系列的数学与代码任务上评测,较弱 proxy 产出的信号能稳健且可调地增强更强的主模型。摘要未给绝对数值。
优点:把探索从对齐里拆出来做成模块化流程,思路干净;迁移「相对改进」而非绝对分布,是支撑弱到强 / 跨模型的关键设计;异步缓存复用能摊薄探索成本;在 Qwen3 数学 + 代码双域验证。 缺点:摘要无绝对增益数字,难判水位;效果吊在「proxy 与主模型的信号保真度」上,proxy 偏了信号就偏;多一个 proxy 训练与工程链路,复杂度上升;Qwen3 之外的家族泛化未展示。
Metacognition in LLMs — Foundations, Progress, and Opportunities
- https://arxiv.org/abs/2607.11881 | 论文清单 | 实用性 3 / 创新性 3
- Yale NLP,作者含 Gabrielle Kaili-May Liu、Mark Steyvers、Arman Cohan 等。
核心动机:元认知(对自身认知过程的认知——知道自己知道什么、不确定什么)被越来越多地视为智能与透明 AI 的核心,但 LLM 究竟「何时、如何、多大程度」具备可用的元认知能力,仍然没有一张全局图。作者自述这是第一份系统梳理 LLM 元认知的综述。
横向对比:这是综述 / 分类工作而非实证研究。它给出领域 taxonomy,汇总三条技术线——度量与评测元认知的方法与基准、激发 / 增强 / 应用元认知的技术、以及由此引出的开放问题与未来方向;配套开源了一份持续维护的论文清单。
优点:把一个正在快速膨胀却分散的方向做了首份系统分类,orientation 价值高;论文清单可直接用;把元认知与透明性 / 安全性、以及 Agent 的自我监控 / 置信度估计连了起来。 缺点:综述性质,无新方法 / 新结果;taxonomy 的边界划分主观;领域年轻,覆盖很快会过时;对工程的直接收益偏间接。
Harness / 工程实践
ACQUIRE — Know Before Fix:QA 驱动的仓库知识获取
- https://arxiv.org/abs/2607.11111 | 实用性 4 / 创新性 3
- 上海交通大学 + 匹兹堡大学 + 广东以色列理工学院,作者含 Haotian Lin、Xiaodong Gu、Beijun Shen 等(13 人)。
核心动机:LLM 编码智能体推进了自动 issue 修复,但常因对仓库理解不足而犯事实性错误;已有「先探索再修」的做法是围绕「怎么修」去探索,识别不出智能体真正的知识缺口,喂回去的上下文因此不精准。这是典型的 agent 运行时上下文构造问题,归入 harness / 工程实践。
横向对比:ACQUIRE 模仿「资深开发者先读懂陌生代码、再动手改」的习惯,把知识获取与补丁生成拆成两阶段——第一阶段一个 Questioner 抛出有针对性的问题、一个 Answerer 通过自主探索给出证据锚定的回答,攒成结构化知识;第二阶段 Resolver 拿着这套 QA 知识去生成有依据的补丁。在 SWE-bench Verified 上,相比代表性的「预修复探索」方法,Pass@1 最高提升约 4.4 个百分点,且额外成本与耗时可控。
优点:把「先懂再改」这条人类直觉落成清晰的两阶段 harness 分解;用「提问—证据回答」显式补齐知识缺口,比笼统探索更有的放矢;在权威的 SWE-bench Verified 上有可量化正增益;开销「modest」。 缺点:+4.4pp 属中等增益,非质变;知识质量吊在 Answerer 的探索能力上,探偏即失真;多一轮 QA 意味着额外 LLM 调用与延迟;摘要无公开代码链接,且只在 SWE-bench Verified 验证。
Eval / 评测
AdvancedMathBench — 高等数学证明的生成与验证基准
- https://arxiv.org/abs/2607.11849 | 实用性 4 / 创新性 4
- 作者含 Lingkai Kong、Wenwei Zhang、Kai Chen 等(13 人)。
核心动机:LLM 在高中 / 奥赛数学上表现不错,但高等数学能力到底如何还说不清;现有基准覆盖窄,又多靠「最终答案对不对」或粗粒度评判,导致推理过程是否成立没被认真测。
横向对比:AdvancedMathBench 拆成两块——主件 ProverBench 收 296 道本科到博士资格考水平的证明题,配一条在专家标注上训练出来的自动验证流水线,既给对错判定、也给细粒度的证明错误定位;VerifierBench 另收 888 条模型生成的证明轨迹(带专家 ground truth),专门测「模型能不能判断一段证明是否成立」。关键数字:证明生成最强的 GPT-5.5-xhigh 拿到 75.8(本科组)/ 66.1(资格考组);而证明验证最强模型的 balanced F1 只有 65.1,且真负率偏低——说明**「揪出关键错误」仍是主要瓶颈**。
优点:把「证明生成」与「证明验证」拆开分别测,戳中当前 eval 只看终答的盲区;专家标注支撑细粒度错误定位;用 F1 65.1 + 低真负率这组硬数字点出「模型不会可靠地发现证明里的错」;本科 / 资格考难度填补了奥赛之上的空白。 缺点:296 + 888 规模偏中等;验证流水线本身也在专家标注上训练,存在一定循环依赖风险;证明评分主观性难完全消除;摘要未给公开代码链接。
世界模型与具身
Xiaomi-Robotics-U0 — 统一具身合成的世界基座模型
- https://arxiv.org/abs/2607.11643 | 项目 | 实用性 3 / 创新性 4
- 小米机器人,作者含 Xinghang Li、Huaping Liu 等(24 人)。
核心动机:图像 / 视频生成基座模型泛化很强,但直接搬到具身任务上会撞墙——具身需要多视角一致性、几何连贯性、以及机器人本体约束;而用有限的机器人数据去微调这些基座,又常常把预训练好的视觉知识给「洗掉」。落点在具身场景生成与真实操作控制,故收入具身线。
横向对比:U0 是一个 380 亿参数的多模态自回归模型,把「具身生成」当成「图像 / 视频生成基座」的自然延伸来做——联合优化文生图、图像编辑、具身场景生成、具身迁移、具身视频生成多项任务,目标是保住预训练泛化的同时适配具身设定。结果:在具身场景生成与迁移的人类评测中优于 GPT-Image-2.0;在 World Arena 的具身视频生成上排名第一;并把 pi_0.5 在真实操作任务上的分布外成功率从 36.9% 提到 63.2%。代码与 checkpoint 已开放。
优点:用一个 380 亿参数骨干统一「生成」与「具身」多任务,且刻意保留预训练视觉知识;下游给出实打实的迁移收益(pi_0.5 OOD 36.9%→63.2%);World Arena 具身视频生成第一;开放了代码与权重。 缺点:380 亿参数偏重,部署与推理成本高;与 GPT-Image-2.0 的对比走人类评测,主观性大;「世界基座」本质仍偏生成式,闭环真实机器人控制的覆盖面尚不清晰;World Arena 属单一来源榜单,需外部交叉验证。