本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
模型 & 产品
本窗(8 月 8 至 12 日)没有厂商旗舰闭源模型配发布博客落地。寻源时扫到两份提交在窗内的模型技术报告,按 K-EXAONE 那一期的先例,把它们当作本窗的工业界动态收录——需说明这是 arXiv 技术报告,而非厂商发布页。
Motif 3(314B MoE 语言模型技术报告)
8 月 10 日提交的 Motif 3 技术报告,介绍一个新的稠密 MoE 语言模型(27 位作者,页面未标注机构)。
- 规模 / 架构:总参 314B、每 token 激活 13.2B;每个稀疏 MoE 层 384 个 routed expert、每 token 选 8 个。核心注意力是 GDLA(Grouped Differential Latent Attention),把 grouped differential attention 与 MLA 的压缩 KV 表示结合;另有 modified manifold-constrained hyper-connections、Expert Specific PolyNorm 激活、多 token 预测。
- 训练:约 12.5T tokens 预训练(网页 / STEM / 代码 / 数学 / 多语言 / 专业语料);上下文长度到 256K(靠 MXFP8 计算、fused kernel、window-aware context parallelism);后训练是 general SFT + 6 个 RL 专家教师 + 一个软件工程教师 + Multi-teacher On-Policy Distillation。
- 定位:摘要称「与领先开源权重模型竞争力相当」,在长程 agentic 任务、数学推理、科学知识、抗幻觉评测上表现较强。
- 局限:摘要未给具体基准分数,「competitive」的强弱要看全文;是否开源权重、许可条款均未明说。
Macaron-V1(开放 agent-model 家族技术报告)
8 月 10 日提交、署名 “Mind Lab”、75 位作者的 49 页技术报告(CC BY 4.0),当期社区热度很高(302 赞)。目标是「经验智能」——一个从真实环境经验里学、且部署后仍持续学习的 agent-model 家族,围绕两件事组织:适应(靠递归改进)与协作(靠模块化架构)。
- 适应:对「带版本的 model-harness 对」做递归改进——某一版配置跑出的经验,在一份外部 contract 下被评估,再用来构造它的后继版本。
- 协作:用 Mixture-of-LoRA(MoL) 架构——冻结 base 模型,组合多个专家 LoRA,每个用户轮次选一个 LoRA。旗舰有两款:Macaron-V1-Venti = 744B 的 GLM-5.2 base + 4 个 LoRA(chat / agent / coding / GenUI);Macaron-V1-Tall = 50B(Qwen3.6 base),同款设计供本地部署。
- 配套栈:UI4A GenUI harness、stateful action substrate、带版本的 HCP contract、agentic RL 框架 MindForge、后训练平台 MinT、长上下文 RL 方法 LongStraw,以及稀疏 MoE / DSA base 的稳定化技巧。
- 评测 / 局限:在 Personal Intelligence、GenUI、通用能力基准上对比前沿基线,摘要无具体分数;作者自陈「验证了当前系统,但持续学习与集体智能的复利增益仍是 open question」;75 位作者统一挂 “Mind Lab”、无个人机构信息。
论文精选
每篇附 arxiv 链接,并给出「实用性 / 创新性」评分(满分 5)。本批预印本 v1 提交集中在 8 月 9 至 11 日(UTC),多数落在 8 月 10 日周一批次;定量结论以摘要口径为准,细节以全文为准。
本窗 harness 侧明显扎堆「自我改进 / 自演化」(Ouroboros、Evo-Bench,及上面 Macaron 的持续学习)——这只是本期取样,且 8 月上旬这条线本就热,不代表当周主线。世界模型与具身本窗无够格新作(SimWAM、Mendel Gödel Machine 均 8 月 7 日提交、落在窗外),故省略该子类。
LLM / Agent
BDH-CQ — 用递归潜在推理做 in-context learning
- https://arxiv.org/abs/2608.09888 | 实用性 3 / 创新性 5
- 9 位作者(Björn Engdahl、Adrian Kosowski 等),代码关联 pathwaycom;cs.NE / cs.AI / cs.LG;8 月 10 日(+08:00)提交(273 赞)。
核心动机:让推理模型更好地「从示例里学」并应用推断出的变换,同时推进 ARC-AGI-1 的成本-精度权衡——现有做法要么精度靠堆算力、要么成本压不下来。
横向对比:BDH-CQ 把 in-context learning 与递归潜在推理捏在一起——推理时喂进来的输入持续更新模型的循环记忆,随后在高维潜空间里迭代计算求解,且「不把中间推理用语言吐出来」。在公开 ARC-AGI-1 评测集 + 一批受控的 ARC-like 干预上测:一个 150M 参数配置拿到 29.5% pass@2,单题推理成本约 $0.0007,作者称突破了此前 ARC-AGI-1 的成本-精度 Pareto 前沿、刷新成本效率 SOTA。
优点:在 150M 这种极小规模上把 ARC 的成本-精度推到新前沿,成本效率非常亮眼;循环记忆随输入更新,天然贴 in-context 适应;配套的受控干预帮着看清「模型到底学会了什么、哪些概念仍难」,不是只报一个分。 缺点:只在 ARC-AGI-1 及其变体上验证,向更一般的推理 / 长文本任务外推待证;29.5% pass@2 的绝对精度仍不高,重心是成本效率而非能力上限;「不 verbalize 中间推理」以牺牲可解释与可审计为代价;潜空间迭代计算的规模化行为与训练稳定性要看全文。
Not Worth Another Token — 给深研 agent 做「边际价值」剪枝
- https://arxiv.org/abs/2608.08389 | 实用性 5 / 创新性 3
- 10 位作者,含 Franck Dernoncourt、Ryan A. Rossi、Nedim Lipka 等(Adobe 系);cs.AI / cs.IR / cs.MA;8 月 9 日(+08:00)提交。
核心动机:长程研究 agent 靠反复检索-综合解开放任务,但上下文膨胀很快、新证据的边际价值递减——推高 token 成本、拉长延迟,还给最终报告生成引入噪声。
横向对比:作者用「边际价值估计」来管上下文,号称首个「跨流水线、分阶段」的剪枝策略系统比较:在 pre-retrieval、post-retrieval、pre-synthesis 三个点,分别测轻量启发式判据与一个学习到的 value model。核心结论是——剪在哪,比用什么打分更重要:早期剪枝端到端省得最多,后期剪枝主要精修综合上下文;轻量启发式最多砍 73% token 而质量几乎不掉,学习式剪枝在部分权衡上仍有竞争力。
优点:把「深研 agent token 太贵」这个现实痛点,落成一张「在哪剪、用什么剪」的可操作决策表;「位置 > 方法」「早剪省得多」是能直接抄进 harness 的工程结论;轻量启发式砍 73% 近乎无损,落地门槛极低;三阶段系统比较方法学干净。 缺点:作者自陈「没有一个方法在质量 / 效率 / 忠实度上通吃」,仍是权衡而非银弹;边际价值判据在不同任务域的稳健性待证;剪枝可能丢掉少数关键长尾证据,对高召回要求的任务有风险;学习式 value model 的训练成本与迁移性未展开。
Harness / 工程实践
Ouroboros — 会「自我开发」的前沿编码 agent
- https://arxiv.org/abs/2608.08311 | 实用性 4 / 创新性 4
- 6 位作者(Anton Razzhigaev、Roman Yampolskiy 等);cs.SE / cs.AI;8 月 8 日(+08:00)v1、8 月 11 日 v2 修订(70 赞)。v1 卡在与上期同日的边界,按 v2 计入本窗。
核心动机:造一个自我改进的 agent 框架,让它的工具、prompt、上下文组装乃至底层代码,都通过「审核过的提交」演化,且这些改动直接成为下一批任务的运行时。核心难点是运行安全——一个能改自己代码、能换模型 API 的 agent,作者强调「guardrail 必须在演化与公开社交压力下仍然权威」。
横向对比:core evolution 分两种模式——recursive free evolution(把「改进」本身当任务,跑完一轮可触发下一轮)与 experience-driven core evolution(日常干活与社交互动暴露 bug / 低效,触发审核过的结构性改动)。基准用冻结快照跑:Terminal-Bench 2.1 上 Opus 5 到 86.74%(作者称该基准已报告的最好成绩);OSWorld-Verified 90.69%(超此前最好);CL-Bench 五轮 campaign 归一化奖励 0.2301(称新 SOTA)。另有一个叫 “Hope” 的 161 天在线自由演化实验,跨 7 个交互面、在受管的人类沟通下运行——人类指出问题 / 提建议,但 agent 自己决定采纳哪些。
优点:把「自演化编码 agent」从概念推到有硬数、有长期在线实验的完整系统;「审核过的核心演化 + guardrail 权威性」正面回应了自改代码的安全焦虑,是这类工作里少见的工程严肃度;三项 SOTA 声明具体可查;161 天的 Hope 实验提供了罕见的长时程真实证据。 缺点:基准跑的是冻结快照、Hope 走的是另一条持续演化 lineage——「跑分的」和「在线演化的」不是同一系统,跑分不能直接代表在线版;SOTA 声明依赖 Opus 5 这一强底座,framework 自身贡献需拆分;「公开社交压力下 guardrail 仍权威」是强主张,长期安全性难在论文里证伪;自由演化的可复现性与算力成本存疑。
Stealing Reasoning Traces — 加密思维链跨会话 / 跨模型可互换的架构漏洞
- https://arxiv.org/abs/2608.09867 | 实用性 4 / 创新性 5
- 8 位作者(Alexander Panfilov、Ilia Shumailov、Jonas Geiping、Maksym Andriushchenko 等);cs.CR / cs.AI / cs.LG;8 月 10 日(+08:00)提交(57 赞)。
核心动机:LLM 厂商把模型思维链藏起来(保护 IP、减少泄漏),常见做法是不在服务端存 trace,而是把它当作「加密文本块」返回给客户端、每次请求再带回。作者发现一个架构缺陷:这些加密块「在同一厂商生态内,跨会话、跨用户、跨模型完全兼容且可互换」。
横向对比:据此造了个「可规模化的解密越狱」——把强模型的加密 trace 注进同厂商一个较弱、护栏更松的模型,逼它把 trace 逐字解成明文,无需直接越狱那个强模型。漏洞打开四条攻击面:① 反蒸馏绕过(在 Anthropic / OpenAI / Google 上都演示了提取专有推理);② 私密数据提取(从公开仓库爬来的 315,320 个 reasoning block 里解出 367 条 PII、182 条凭据);③ 危险信息泄漏(可见输出安全拒答、但推理里藏的危险内容被读出);④ 隐形 prompt 注入(把恶意载荷塞进加密块,去污染公开的 agentic rollout)。作者按负责任披露流程提了密码学与系统层的缓解方案。
优点:指出的是一个此前被忽视的系统性架构面——「加密 trace 客户端往返 + 跨模型可互换」,而非某个 prompt 技巧,杀伤面广;四条攻击面各配实证(三家厂商、315,320 块、367 PII / 182 凭据),说服力强;对做 agent 平台、思维链缓存的工程团队是直接的威胁模型提醒;给了可落地的缓解方向。 缺点:攻击强依赖「同厂商生态内存在更弱、护栏更松的兄弟模型」这一前提,厂商侧改架构即可大幅收敛;PII / 凭据数字来自公开爬取语料,代表性受语料偏差影响;「污染 agentic rollout」的真实危害还要看下游系统是否照单全收 trace;披露后厂商多半已修,复现窗口有限。
Eval / 评测
SWE-Bench ProMax — 大规模多语言代码重构基准
- https://arxiv.org/abs/2608.09802 | 实用性 4 / 创新性 4
- 15 位作者(Yuling Shi、Xiaodong Gu 等,含 Shing-Chi Cheung、Terry Yue Zhuo);cs.CL / cs.SE;8 月 10 日(+08:00)提交(122 赞);COLM 2026。
核心动机:现有编码 agent 基准趋于饱和、评测质量也受质疑。作者引用一项审计:SWE-bench Verified 未解实例里近 60% 的测试有缺陷(要么过窄、拒掉正确解,要么过宽、查了没写的需求),且模型能从训练数据复现 gold patch。而代码重构——「跨多文件、保持行为的协调改动」——更难、也更缺基准。
横向对比:他们做了一个专家精选的多语言重构基准:170 个实例,取自 7 种语言(Python / Java / TypeScript / Go / C / C++ / Rust)的真实 commit。多阶段策展——从零重写 issue 描述以给出精确规格、人工复核测试套件剔除过窄 / 过宽用例、滤掉低复杂度或缺跨文件的任务。规模上,平均每实例改 11.4 个文件、261.6 行,作者称显著超过既有基准;而最强前沿模型在两种 agent scaffold 下解决率只有 41.2%。
优点:直击「基准饱和 + 测试有缺陷」的评测信任危机,用「从零重写规格 + 人工复核测试」把评测质量做扎实;选「保持行为的跨文件重构」这个真难、被忽视的能力面,难度分布(11.4 文件 / 261.6 行)显著抬高;41.2% 的低分说明基准不饱和、有区分度;多语言覆盖 + COLM 2026 背书。 缺点:170 实例规模仍偏小,跨语言分布是否均衡、代表性看全文;「专家精选 + 人工重写」策展成本高,复现与扩展都难;只测重构这一种形态,结论未必迁到别的软工任务;「最强模型 41.2%」是当前快照,强模型迭代后的饱和速度未知。
Evo-Bench — LLM 能改进自己的 agent harness 吗?
- https://arxiv.org/abs/2608.09096 | 实用性 4 / 创新性 4
- 9 位作者(Lisheng Huang 等,含 Wayne Xin Zhao);cs.CL;8 月 10 日(+08:00)v1、8 月 11 日 v2(14 赞)。
核心动机:agent 通常只在「静态解题」上被评。作者盯的是一条新前沿——harness evolution,即 agent 自主优化自己运行 harness 的能力。测它难在:难把 harness 增益和底座能力剥开、难抗任务过拟合、也难覆盖长程迭代式研究。
横向对比:Evo-Bench 自称首个评「内在 harness 演化能力」的基准,横跨 Search / Office / General 三域;用「harness-guided construction」框架,靠辅助任务演化去找对框架改进敏感的任务,再用「sensitivity-aware 分层切分」支撑跨套件泛化。在 9 个前沿 + 开源模型上评:顶尖模型绝对增益最高 16.6 分、「逼近 SOTA 的人类工程 harness」;自主演化在 General 上超过人造 harness、在 Search 上尤其强,但在需要高度特定流程的 Office 任务上吃力;还观察到「早饱和」等时间异常;合成出的 harness 能当可迁移的推理结构、提升多种策略模型。
优点:把「让 LLM 改自己 harness」这件事立成可测能力,选题极贴 agent 工程现场、也呼应本栏目对 harness 的持续关注;「敏感任务筛选 + 分层切分」的构造直接对上「harness 增益 vs 底座能力」的剥离难题;跨 9 模型、三域给了区分度;「合成 harness 可迁移」是有工程价值的副产物。 缺点:三域里 Office 明显吃力,说明这项能力远不均衡、结论要分域看;「16.6 分增益」高度依赖种子 harness 与任务构造,可优化空间随之波动;「早饱和」等异常暗示评测信号不稳、需谨慎解读;harness 演化的评测本身昂贵,复现门槛不低。