本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。
模型 & 产品
K-EXAONE 2.0(LG AI Research 开源权重模型)
8 月 5 日,LG AI Research 放出 K-EXAONE 2.0 技术报告与开源权重(Apache 2.0)。它不是从零重训,而是把上一代 K-EXAONE upcycle 成 Mixture-of-Experts 架构后扩容而来。需说明的是,这是一篇 arXiv 技术报告 + 开源权重发布,而非厂商发布博客,故放在「模型 & 产品」里当作本窗唯一一条工业界动态收录。
- 规模:总参数 750B、每 token 激活约 37B,作者称「容量是前代的三倍多」;上下文长度支持到 256K;多语言覆盖从 6 种扩到 10 种。
- 训练:持续预训练 + 难度聚焦的 mid-training + 后训练三段式,目标锁定推理、agentic coding、多语言,以及扎根韩国社会文化语境的安全性。
- 生态 / 接入:Apache 2.0 开源权重,可自托管;作者称最大增益在 agentic coding 与长上下文理解,长上下文检索与安全性上优势最明显。
- 局限:摘要用「九个贴近实用场景的评测类别」这类定性口径,未给出具体基准分数,「与其它开源权重模型竞争力相当」的强弱要看全文;750B MoE 的部署成本对多数团队不轻。
论文精选
每篇附 arxiv / 项目链接,并给出「实用性 / 创新性」评分(满分 5)。本批预印本 v1 提交时间集中在 8 月 5 至 6 日(UTC),部分定量结论以摘要口径为准,细节以全文为准。
LLM / Agent
RST — 长程终端任务的「递归合成」
- https://arxiv.org/abs/2608.05466 | 实用性 5 / 创新性 4
- 10 位作者,Zhongzhi Li 等;HuggingFace 页面标注腾讯混元提交,cs.AI;8 月 6 日(+08:00)提交,当期社区热度最高(213 赞)。
核心动机:训练长程终端 agent(在真实 shell / 终端里连续操作、跨多步完成任务)缺的是规模化、可验证的任务数据。靠人工编写既贵又难覆盖长尾,而现成基准数量有限、难度分布也窄。
横向对比:RST 是一个递归的、带验证的任务合成框架:从少量「已验证的种子任务」出发,递归地扩展解法、重新对齐验证器与指令、再放进沙箱里跑通验证——如此一轮轮把任务「长」出来。作者用它造出 37,484 个任务,单个成本约 0.05 美元;难度随轮次显著上升,且「跑到 15 轮仍看不到天花板」;用合成轨迹训练后,模型在多个终端 agent 基准上都有提升(摘要以「several terminal-agent benchmarks」的定性口径给出,未逐一列分数)。
优点:把「长程 agent 缺数据」这个卡脖子问题,转成一条可自我扩张、成本极低(约 5 分钱一题)的合成流水线,工程可复现性强;「递归 + 沙箱验证」保证造出来的任务是可解、可判的,不是噪声;难度随轮次自然攀升,天然形成 curriculum;「15 轮无天花板」暗示这条路还能继续加码。 缺点:合成任务的真实性与分布偏差是根本风险——递归自我扩展容易漂到「模型擅长的形状」上;摘要未逐一给下游基准的绝对分数,增益幅度要看全文;验证器 / 指令的重对齐质量决定数据质量,坏种子会顺着递归放大;单题 0.05 美元不含验证失败重试与人工审计的隐性成本。
ABSeeker — 从答案倒推,给搜索 agent 做稠密信用分配
- https://arxiv.org/abs/2608.05102 | 实用性 4 / 创新性 4
- 7 位作者,Siheng Chen 等(上海交大系),Yijun Lu 领衔;8 月 6 日(+08:00)提交(61 赞)。
核心动机:训练长程搜索 agent 时,回报只在「最终答案对不对」这一层稀疏地给,中间的每一步检索到底有没有用,标准 RL 分不清——好步、废步、冗余步被一视同仁,信用分配太粗。
横向对比:ABSeeker 提出 Answer-Backtracked Credit Assignment(ABC),把稀疏的轨迹级结果变成稠密的步级奖励。两段式:先做「答案回溯的线索恢复」——从答案往回推,重建解这道题所需的中间线索;再做「线索锚定的步打分」——拿每一步检索去对照这些线索评分。分数喂进两种训练变体:ABC-SFT(按分重加权每轮 loss)与 ABC-GRPO(把步分当 GRPO 奖励)。基于 Qwen3.5-4B、仅用 8.5k 训练样本,在 BrowseComp 上拿到 37.3%(加上下文管理到 55.3%)、BrowseComp-ZH 39.1%(→ 52.9%),作者称显著超过同为 4B 量级的 agent、并逼近约 30B 量级的模型。
优点:「从答案倒推线索、再拿线索给每一步打分」是个干净的稠密化思路,直接对上搜索 agent 信用分配太稀疏的痛点;4B + 8.5k 样本就逼近 30B,样本与参数效率都很亮眼,复现门槛低;同一套 ABC 分数能接 SFT 也能接 GRPO,方法弹性好;给了 BrowseComp 中英双榜的硬数字。 缺点:线索恢复要「从答案往回推」,隐含依赖已知正确答案,向没有金标答案的开放搜索外推存疑;线索重建本身的质量与偏差会直接污染步级奖励;只在搜索 / 浏览类任务上验证,迁到别的长程 agent 域待证;「加上下文管理」带来的十几个点增益说明相当一部分收益来自正交手段,需拆清 ABC 本身的贡献。
EnvACE — 用「世界预演」把环境动态内化进策略
- https://arxiv.org/abs/2608.06197 | 代码 | 实用性 4 / 创新性 4
- 12 位作者,Zishan Xu 领衔,含 Weiwen Liu、Weinan Zhang 等(腾讯系),cs.AI;8 月 6 日(+08:00)提交。
核心动机:agentic RL 训练往往依赖昂贵的真实环境交互或难以对齐的模拟器。作者想绕开这道成本:让模型把「动作—反馈」的环境动态直接吸进自己的参数里。
横向对比:EnvACE 让同一个策略在两种角色间交替——先生成一个工具调用,再自己扮演环境、产出该调用「本应」引发的响应,然后用这段预演出来的响应去指导后续决策;两种角色用任务成功奖励端到端一起训。这样模型内部就长出一个「agent 世界模型」,推理时可以「先私下预演、再真正执行」,在不增加外部交互的前提下改善结果。在 BFCL-v4、τ²-Bench、VitaBench、FinMCP-Bench 四个基准上评测,作者称整体表现「强且可迁移」,超过靠堆环境交互的基线(摘要未给具体分数);代码已开源。
优点:把「训练要真环境」这个大成本项,换成模型自我预演,思路上和「把外置能力内化进骨干」的近期潮流一致;「先私演再执行」在推理期也能用,等于送了个无额外交互开销的自校验;四个 agent / 工具调用基准覆盖面不错;开源便于跟进。 缺点:模型自己扮环境,预演的响应可能系统性失真——若世界模型学歪,越预演越自信地错;摘要无任何具体分数,「超过环境-scaling 基线」的幅度难独立核验;对反馈可完全内化的假设,在高随机性或强外部依赖的环境里未必成立;端到端联训两种角色的稳定性与超参敏感度要看全文。
Harness / 工程实践
OneDayAgent — 面向开放长程任务的「统一 harness」
- https://arxiv.org/abs/2608.05013 | 实用性 4 / 创新性 3
- 6 位作者,Jingsheng Zheng 等,含 Huajun Chen、Ningyu Zhang(浙大 NLP / ZJUNLP),cs.CL / cs.HC / cs.MA;8 月 5 日凌晨(+08:00)提交,标注「Ongoing work」。
核心动机:真实的开放式请求常常横跨不同环境与模态、要拉很长的时间线,单一能力点解决不了;作者想要一套harness 层面的统一框架,把这类任务当成一个「可管理的执行过程」来跑,而不是指望某个更强的底座模型一口气搞定。
横向对比:OneDayAgent 把一个开放请求转成受管的执行流——拆成有界子任务、在上下文压力下维护执行记忆、并对最终交付物做校验与修复。关键主张是「一套 harness 联合应对多种失败模式」,且跨模型后端通用。在自建的 AgentIF-OneDay(104 个任务) 上评测,用 GLM-5.2 后端拿到整体 0.821 的 SOTA;在来自三个模型家族的五个后端 LLM 上「无需调参即可泛化」。
优点:把注意力从「换更强的模型」移到「把 harness 做扎实」,正是本栏目关心的方向;「有界子任务 + 上下文压力下的执行记忆 + 交付物校验修复」这套拆法,是可直接套用的工程模式;跨五个后端、三个家族不调参就迁移,说明收益来自 harness 结构而非某个模型的运气;给了 AgentIF-OneDay 上 0.821 的硬数。 缺点:AgentIF-OneDay 是自建基准,其代表性与难度分布决定结论说服力,缺横向公认基准的旁证;标注「Ongoing work」,成熟度与完整消融待补;「联合应对多种失败模式」较笼统,哪一部分(拆解 / 记忆 / 校验)贡献几何,摘要没拆;0.821 的绝对水平相对其它 harness 强多少,需看全文对比。
Activity Frames — 把屏幕活动「确定性编译」成 agent 记忆
- https://arxiv.org/abs/2608.05784 | 实用性 4 / 创新性 4
- 单作者 Nossa Iyamu,cs.AI;8 月 6 日(+08:00)提交;schema / 编译器 / 评测 harness 已开源。
核心动机:computer-use agent 要「记住用户干过什么」,但把原始屏幕录制直接塞进上下文既贵又噪。作者要的是一条**无模型(model-free)**的管线:不记「用户说了什么」,而是把「用户实际做了什么」编译成结构化、可直接读的记忆。
横向对比:Activity Frames 把捕获流切成带类型的「活动帧」,记录应用、时序、输入量等字段。因为全程不过模型,输出是「字节级确定、可缓存、可机械审计」的——这点正是它和「让 LLM 去总结屏幕录制」的关键区别。第二个用途是把同一个编译器当成本度量工具,导出两个此前没被量化的 agent 成本参数:Routine Overhead Ratio(R)与例程复现率(h)。在一个用户 51 个活跃日、128,756 帧的语料上:把一天的原始捕获压成上下文块「小 86 倍、耗时 68 ms」;agent 读这个块的准确率 98.4%(Wilson 95% CI 91.7–99.7%),而让 LLM 去总结同样数据只有 66–80%;R 报到 60–343 倍,可委派的例程复现率样本内 9.0%、样本外 7.7%;确定性例程重放「零模型 token」现场跑通。
优点:用无模型确定性编译替掉「LLM 总结屏幕」,把准确率从 66–80% 抬到 98.4%,且字节级可复现、可审计——这对可观测性极重要;86× 压缩 / 68ms 的开销数字说明它是可上生产的预处理层;顺手量化出 R、h 两个 agent 成本参数,给「值不值得委派」提供了可算的依据;全套开源。 缺点:数据只来自单个用户、单份语料,跨人 / 跨工作流的泛化是最大问号;「确定性编译」对结构化屏幕活动有效,遇到高度非结构化或视觉密集的场景可能覆盖不足;记录「做了什么」而非「为什么」,语义理解仍要交给下游模型;隐私与录屏合规是这类被动捕获绕不开的前提。
Eval / 评测
HarnessOpt-Bench — 评 LLM「优化 harness」这件事本身
- https://arxiv.org/abs/2608.06301 | 实用性 4 / 创新性 4
- 7 位作者,Varun Ursekar 等(Scale AI),cs.AI / cs.CL / cs.LG;8 月 7 日(+08:00)提交。
核心动机:agent 系统的性能越来越取决于围绕模型的那圈 harness——prompt、工具、控制流、记忆、编排代码。那么「让 LLM 自动去改进一套 harness」到底行不行、能不能测出高下?此前没有专门的基准。
横向对比:HarnessOpt-Bench 把它设成一个端到端的 harness 优化任务:给优化器(一个 LLM + 编码 harness)一套种子 harness、评测反馈和固定预算,让它反复改、最后提交一个候选;候选按在留出测试集上相对种子的提升打分,全程有可信执行环境守住评测边界、并留存版本供审计。规模:5 个前沿 LLM 当优化器、在共享编码 harness 与各自原生 harness 两种条件下、4 个下游任务、111 次计分运行。核心发现:优化器模型之间的分化,比它们所用的编码 harness 之间更大;原生 harness 并不「更好」;结果随任务与种子条件大幅波动——说明「优化 harness」是一项可测量、有区分度、且远未做满的能力。
优点:直接把「harness 优化」立成一个可测的一等能力,选题极贴 agent 工程现场,也呼应本栏目对 harness 的持续关注;「相对种子的提升 + 固定预算 + 可信执行环境 + 版本留存」的评测设计严谨、抗刷分;「优化器差异 > harness 差异」这个发现,对「到底该换模型还是打磨脚手架」很有指导;来自 Scale AI,评测工程可信度加分。 缺点:111 次计分运行、4 个下游任务,规模仍偏小,跨任务方差大意味着结论要谨慎外推;「相对种子提升」高度依赖种子选取,种子差 / 好都会左右可优化空间;评测本身昂贵且随机(作者也点明),复现成本不低;只测「让 LLM 改 harness」,人机协同改进 harness 的现实主线未覆盖。
Skill²-Bench / Skill Entropy — 跨技能长程推理的基准与训练信号
- https://arxiv.org/abs/2608.05139 | 代码 | 实用性 4 / 创新性 4
- 9 位作者,Yinghui He 等,含 Mengdi Wang、Sanjeev Arora(普林斯顿系),cs.CL;8 月 6 日(+08:00)提交。
核心动机:现有基准大多考「单项技能」,但真实长程任务是跨技能的——每一步需要不同的推理技能、又要接住上一步的产出。模型「在技能间切换」的能力,一直缺一把尺子来量。
横向对比:作者提出 Skill Entropy——量化「切换技能有多难」的指标,并据此建 Skill²-Bench:横跨「9 个可验证 / 开放域、558 种技能」的跨技能任务,按 skill-entropy 分成三档难度。训练侧把 skill entropy 转成信号,做 Skill-Entropy RL:让模型在每一步同时预测「答案」和「用的是哪种技能」,奖励混合步正确性与对金标技能序列的对齐。关键发现是一条「技能切换鸿沟」——任务熵越高、准确率越掉(在 8 个前沿 + 4 个开源模型上验证)。用 Skill-Entropy RL 后:Qwen3-4B-Instruct 34.4% → 68.4%、Qwen3-1.7B 14.6% → 40.1%,且能迁到现成数据(如 OpenR1-Math)。
优点:把「切换技能有多难」显式量化成 Skill Entropy,并据此分档建库,比「测单技能」更贴长程任务的真实结构;同一把尺子既能当评测指标、又能转成训练奖励,评训一体很漂亮;小模型上的增益极大(4B 翻倍、1.7B 近三倍),复现门槛低;「任务熵↑准确率↓」这条鸿沟在 12 个模型上都成立,说服力强。 缺点:奖励依赖「金标技能序列」,标注这套序列本身有主观性与成本;「技能」的粒度与 558 类的划分是否正交、是否穷尽,要看全文;小模型上的大幅增益,在已很强的前沿模型上还剩多少空间未充分展示;Skill Entropy 作为难度代理,与人类感知难度的相关性未量化。
The Personalization Mirage / MirageBench — LLM 会编造用户画像,且「自我监控」会误导你
- https://arxiv.org/abs/2608.04570 | 实用性 4 / 创新性 4
- 3 位作者,Yushi Sun、Yanjie Zhang、Rui Sheng(HKUST 系);8 月 5 日(+08:00)提交。
核心动机:带持久记忆的个性化系统里,LLM 常常**「过度推断」(over-inference, OI)**——凭不足的证据编出用户属性。更麻烦的是,能不能靠模型「自己监控自己」来发现这种编造?作者要把这两件事量化。
横向对比:他们建 MirageBench 来测 OI:150 个人设(刻板 / 反刻板 / 中性)、6 类任务、7 个家族的 12 个模型、共 143,616 条被判定的断言;judge 与人类标注在 400 条上的一致性 Cohen’s κ 达 0.863(四分类)/ 0.900(二分类)。核心结论有二:其一,每个模型都在 35%–49% 的断言上过度推断(跨模型均值 41.6%);其二,一个叫「自我监控反演」的现象——模型自评的 OI 与独立 judge 测得的 OI 负相关(ρ = −0.60,p = 0.044,n = 12),也就是说「模型自报的把握」拿来横向比模型时是反着的、不可靠;模型内自审的 AUROC 只有 0.58–0.83。作者据此主张:可信个性化应靠外部验证,而非模型自报。
优点:把「个性化系统里 LLM 编用户画像」这个隐蔽却普遍的失效,量化成一个大规模、judge 一致性很高(κ 达 0.86–0.90)的基准;「自我监控反演」是个反直觉且有工程价值的发现——直接否掉「让模型自评置信度来选型」这条捷径;143,616 条断言、12 个模型的规模够扎实;结论落到「要外部验证」,对做记忆型 agent 的人有直接指导。 缺点:over-inference 的判定终究依赖 judge,尽管 κ 很高,边界断言的「算不算编造」仍有主观空间;ρ = −0.60(p = 0.044、n = 12)样本量偏小,反演结论的稳健性需更多模型佐证;150 人设 / 6 任务的构造与真实用户分布的差距会影响外推;给的是「诊断 + 度量」,如何在系统里落地外部验证、成本几何,属后续工作。