AIGC 前沿研究摘要(2026 年 8 月 5 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 25 日至 8 月 5 日。产品线没有新旗舰模型落窗——Claude Opus 5 差一天(7 月 24 日),Gemma 4 在 4 月,DeepSeek 仅更新了 V4-Flash-0731 checkpoint——故工业界只收两条最贴本栏目主题的动态:Google 把 Agent Skills(SKILL.md + 渐进披露)做进 Genkit Go(7-31),并上线多模型路由网关(8-4)。论文这批 v1 提交时间集中在 7 月 29 至 8 月 3 日(UTC);7 月 24–28 一段本窗内未收,寻源覆盖有限。所选论文大致落在「自演化 / 记忆 / 失败诊断」几类(如 SkillRise、Metis、Model or Harness?、SWE-Touch),但这只是本期取样,不代表当周主线。 ...

2026-08-05 · 46 分钟 · 8223 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 25 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 22 日至 25 日,只有三天,故收得偏精:产品线落在窗内的一手前沿发布是 Anthropic 于 7 月 24 日推出的 Claude Opus 5;论文这批 UTC 提交时间集中在 7 月 22 晚至 23 日,折算到北京时间恰好落在上一期(收到 7 月 21 日提交)之后的空档。如果说前两期的主题是「把智能体运行时的每一环分别抠效率」,本期的共同点更靠上一层:把 agent / harness 本身当成一等构造物——去训练它(OpenForgeRL 在真实 harness 里端到端跑 RL)、去编程它(NOOA 把 agent 写成一个 Python 对象)、去自改进它(AREX 递归审计自己的答案)、去评测它(WorkBuddy、ICAE-Bench 直接考「agent 在真实 harness 上搭项目」)。Opus 5 官方主打的也正是长程自主 agent 与编码——工业界和学术界这一周都把重心压在「智能体作为工程对象」上。 ...

2026-07-25 · 36 分钟 · 6503 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 22 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 20 日至 22 日,只有两天,故收得偏精:产品线落在窗内的一手前沿发布是 Google 于 7 月 21 日一次性推出的 Gemini 3.6 Flash 系列(此前在 5 月 I/O 上承诺、原定 6 月的 Gemini 3.5 Pro 仍未上线,本期不收);论文这批 UTC 提交时间集中在 7 月 20 至 21 日,正好接上上一期(收到 7 月 17 日提交)之后的空档。若说上一期的共同主题是「harness 该怎么建、到底有没有用」,那么本期的主题更下沉一层:把智能体运行时的每一环分别抠效率——上下文(SWE-Pruner Pro)、优化器/RL(ISO、SAT、LLM-as-Coach)、部署(FlashRT)、调试(AgentDebugX)。有意思的是 Gemini 3.6 Flash 官方主打的也正是「更少 token、更少推理步与工具调用就完成多步工作流」——这一周工业界与学术界不约而同地在抠 agent 的效率,而非上限。 ...

2026-07-22 · 39 分钟 · 7053 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 20 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 15 日至 20 日:产品线上唯一落在窗内的一手前沿发布是 Moonshot 于 7 月 16 日转正的 Kimi K3(此前传闻目标 7 月 17 日的 Gemini 3.5 Pro 仍是「coming soon」,未上线,本期不收);论文这批 UTC 提交时间集中在 7 月 14 至 17 日,正好接上上一期(只收到 7 月 13 日提交)之后的空档。本期一个显著的共同主题是 agent harness(智能体运行时脚手架)——同一周里既有人教它「怎么改得动」,也有人质疑它「到底有没有用」,故 Harness 与 Eval 两条线本期都偏厚。 ...

2026-07-20 · 39 分钟 · 7042 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 15 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 13 日至 15 日:这几天没有新的前沿模型发布(GPT-5.6、Grok 4.5、Muse Spark 1.1 都集中在 7 月 8–9 日,Gemini 3.5 Pro 传闻目标 7 月 17 日、尚未上线),产品线只收一条落在窗内、且与栏目「serving 经济学」主题相关的 DeepSeek V4 转正;论文这批于 7 月 14 日在 arXiv 挂出(多数 UTC 提交时间折算到 +08:00 已是 7 月 14 日),正好补上上期(只收到 7 月 10 日提交)没覆盖的 7 月 11–15 日空档。 ...

2026-07-15 · 23 分钟 · 4064 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 13 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本栏目聚焦 AI / LLM / Agent / Harness,不收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。本期时间窗为 7 月 9 日至 13 日:主流模型厂商处于发布淡季(上期已覆盖 GPT-5.6 与 Gemma 4),故产品线只收一条落在窗内、且与栏目主题直接相关的 harness 迭代,重心放在论文。 ...

2026-07-13 · 24 分钟 · 4390 字 · cjraft

AIGC 前沿研究摘要(2026 年 7 月 9 日)

本栏目为每期一版的 AIGC 学术界 / 工业界前沿摘要。选题以人工筛选为主,每篇的分析要点由自动化流程生成,可能存在偏差或不准确之处,仅供参考。 本期起栏目聚焦 AI / LLM / Agent / Harness,不再收录纯图像、纯视频生成方向;世界模型与具身作为「智能体在物理世界的延伸」保留。 ...

2026-07-09 · 31 分钟 · 5622 字 · cjraft

@tarko/agent vs pi-mono

背景与生态定位 最近看了下因为 openclaw 被带火的 pi-mono 框架用法和基本架构, 感觉和 tarko 有很多相似之处, 二者都尽量轻量化、 提供必要的开箱即用的能力、 保留足够的扩展性, 所以想着对二者做一些框架使用、设计理念的对比, 看能否有额外的收获。首先基本情况对比: ...

2026-03-24 · 24 分钟 · 4279 字 · cjraft

Code Mode & Code Execution

背景:MCP 工具调用的问题 2024 年 11 月,Anthropic 开源 Model Context Protocol(MCP)后,社区热情高涨,几个月内涌现出数千个 MCP 服务器。但随着实际应用深入,一个根本性的矛盾暴露出来: ...

2026-03-06 · 24 分钟 · 4369 字 · cjraft