本期:产品线无旗舰落窗,收 Google 两条 agent 工具链动态(Agent Skills in Genkit Go + 多模型路由网关),及 LLM·Agent(跨任务技能进化 / 记忆基础模型)、Harness(失败归因分类法 / 代码删除回避 / ML 工程递归自改进)、Eval(用户中途改代码 / 盲目穷举搜索 / 流式自演化)、世界模型(状态感知游戏世界模型)方向的重点论文精读。
前沿研究
本期:Anthropic 发布 Claude Opus 5(Opus 档跨代、逼近 Fable 5 而价格减半),及 LLM·Agent(递归自改进深度研究 / 经验蒸馏)、Harness(agent 即 Python 对象 / 真实 harness 内端到端训练)、Eval(抗污染编码 agent 基准 / 交互式项目搭建评测)、世界模型(多智能体世界状态寄存器)方向的重点论文精读。
本期:Gemini 3.6 Flash 系列上线(Pro 仍缺席、预热 Gemini 4),及 LLM·Agent(自裁剪上下文 / LLM-as-Coach / RLVR 谱继承 / 异步 RL 稳定化)、Harness(agent 失败归因、实时多模态部署)、Eval(事实完整性基准)、世界模型(交互式长程世界模型)方向的重点论文精读。
本期:Moonshot Kimi K3 转正为首个开放 3T 级模型,及 LLM·Agent(智能体 RL 自蒸馏、推理能力的预训练根源、Muon 优化器)、Harness(可导航手册 / 递归自改进 / 生成式编译)、Eval(Agent 评测基建、harness 演化评测反思)、世界模型(世界-动作模型对抗)方向的重点论文精读。
本期:DeepSeek V4 正式版转正并上线业界首个 API 峰/谷计价,及 LLM·Agent(多智能体互探失败、代理引导后训练、元认知综述)、Harness(QA 驱动仓库知识修 issue)、Eval(高等数学证明生成与验证)、世界模型(小米 U0 具身基座)方向的重点论文精读。
本期:Claude Code 第 28 周密集迭代,及 LLM·Agent(主动式基准、科学血统推理、长上下文 TTT、数据科学因果推理)、Harness 记忆干预、Eval(前端产物交互评测 UI2App)、具身动作生成方向的重点论文精读。
本期:OpenAI GPT-5.6 与 Google Gemma 4 两项模型发布,及 LLM·Agent、Harness 工程实践、世界模型与具身方向的重点论文精读。
本期:Nano Banana 2 Lite / Gemini Omni Flash / LongCat 2.0 三项模型产品,及 LLM·Agent、图像、视频与世界模型方向的重点论文精读。