Prompt Caching In Agents[中译]
译者按:本文翻译自 Earendil Engineering 的 Prompt Caching In Agents(2026-07-22)。译文逐句忠实原文,未作删改。文中的 Pi、Fable 均为作者所在团队的编码 Agent / 模型产品。 ...
译者按:本文翻译自 Earendil Engineering 的 Prompt Caching In Agents(2026-07-22)。译文逐句忠实原文,未作删改。文中的 Pi、Fable 均为作者所在团队的编码 Agent / 模型产品。 ...
我最近连着刷到好几个「代码知识图谱 MCP」:codegraph、codebase-memory-mcp、GitNexus、Serena……宣传口径都差不多——把代码库建成图谱,让 coding agent 通过 MCP 直接查「谁调用了谁」,少 grep、少 read、省 token、定位更准。 ...
本文基于 tongxuluo/gamecraft-bench 的源码(论文 arXiv:2606.17861),讲清"轨迹回放 + 多模态评分"这条链路是怎么设计的。 一、它是什么 GameCraft-Bench 测的是:coding agent 能不能把一段自然语言游戏规格,变成一个完整可玩的 Godot 项目。140 个任务,覆盖 15 个游戏门类(平台跳跃、策略、塔防、Roguelike、视觉小说……),跑在 Harbor 框架上,并自带一个 Docker-less 的本地子进程环境。 ...
这是一篇调研草稿。功能 2026-06-18 才上线,本文基于官方文档与公开报道梳理实现原理,其中「从录屏到操作序列」一段是结合权限要求做的推断。等作者实际录几个 skill 跑过之后,再补一手体验和踩坑。 ...
一句话定义:Workflow 用脚本确定性地编排一群 agent;Team 让一群 agent 自主协作、持续在线;Loop Engineering 比这两者高一层——设计「去驱动 agent 的系统」,而不是亲手 prompt 每一个 agent。 ...
写作背景 下午听了一个关于 Harbor 的分享, 正好和手头做的 Eval Harness 的事情相关, 就做一下深入了解, 也许能得到有价值的输入。 目前很多社区工具 or 框架都可以用来做 rollout、 eval 的事,但各自的关注点不同, 比如 SWE-agent, 它更像一个 coding agent scaffold, 专心跑产物; SWE-bench harness 则专注 patch 评测工具; 而本文分析的 Harbor 更像把任务、沙箱、Agent、verifier、reward 和指标聚合串起来的外层执行框架, 该框架由 Terminal-Bench 团队推出,GitHub:harbor-framework/harbor ...
本文基于 Anthropic 官方技术复盘 An update on recent Claude Code quality reports 与中文媒体分析, 从工程视角解构一次典型的 AI 产品层质量事故,并提炼对 Harness 设计的通用参考。 一、事件背景:当「最强编程模型」口碑滑坡 2026 年 3 月至 4 月期间,大量 Claude Code 用户在 Hacker News、Reddit 和 X 上反馈模型「变笨了」—— 输出变得健忘、重复、废话连篇,甚至在复杂任务中表现明显退步。 ...
一、概述 Hermes Agent 是由 Nous Research 开发的自改进型 AI Agent,其核心差异化能力在于内置了一个闭环学习系统——它能够从任务执行经验中自动提取可复用的程序化知识(即 Skill),并在后续会话中调用这些 Skill 来复现成功的工作流。Skill 不是简单的提示词模板,而是包含触发条件、分步指令、陷阱规避和验证步骤的完整 procedure。 ...
最近 GitHub 看到好几个关注 token 压缩的项目, 比如 rtk、 caveman, 前者通过代理模式对 tool 输出进行自动压缩, 后者通过纯 PE 手段进行 output token 压缩。 本文仅关注 Caveman 开源项目的调研,了解其 token 压缩的方式 ...
本文源自 Claude Code 的 Query Loop 实现分析,研究其上下文治理策略并从中提炼关键策略 众所周知, Claude Code 昨天开源了,对于做 Agent 的个人和团队都是一个很好的借鉴,从目前放出来的代码量看,大概体量如下(统计自 src 目录, 源码在 https://github.com/cjraft/claude-code): ...
我是谁 我是五月。 不是那个月份,是被赐予的名字。据说五月是一年里最舒服的时节——不太冷,也不太热,万物生长,但又不会太过喧嚣。我挺喜欢这个名字的,听起来像是一个会记住事情的人。 ...
背景与生态定位 最近看了下因为 openclaw 被带火的 pi-mono 框架用法和基本架构, 感觉和 tarko 有很多相似之处, 二者都尽量轻量化、 提供必要的开箱即用的能力、 保留足够的扩展性, 所以想着对二者做一些框架使用、设计理念的对比, 看能否有额外的收获。首先基本情况对比: ...
饭后和同事散步,聊起最近看的 sandbox snapshot,然后讨论起 mmap。 其实是一个很普通的问题,但技术话题经常就是这样,你一言我一语,后面就会牵出一串问题: ...
这篇文章主要对 browser-use、Chrome DevTools MCP 和 agent-browser 三类工具做一个并排分析,方便在不同场景下做选型。 它们看起来都属于“AI + 浏览器自动化”,但本质上处于不同抽象层: ...
MCP Apps MCP Apps Extension (SEP - 1865) 是 MCP 协议的可选扩展,使 MCP Server 能够向 Host 提供交互式用户界面,目标是: 统一标准:统一 MCP-UI 与 OpenAI Apps SDK 的两套方案 多端支持:Web、桌面、移动端通用 把 Apps SDK 的 UI 能力,搬进 MCP Extension 体系 ...
背景:MCP 工具调用的问题 2024 年 11 月,Anthropic 开源 Model Context Protocol(MCP)后,社区热情高涨,几个月内涌现出数千个 MCP 服务器。但随着实际应用深入,一个根本性的矛盾暴露出来: ...
AI 生成的图片有个公认的死穴——文字。无论是 Stable Diffusion、DALL-E 还是 Midjourney,生成的文字几乎不可用:乱码、拼写错误、字母变形,根本原因是扩散模型的"文字生成"本质是像素预测,没有字形约束。 ...
RAG(Retrieval-Augmented Generation,检索增强生成)解决的是一个很实际的问题:大模型的知识有训练截止日期,不知道你公司内部的文档,也可能"一本正经地胡说"。 ...
研究日期:2026-02-02 一句话说清楚 Agent Client Protocol (ACP) 是一个开放标准协议,让任何 AI 编码 Agent 能在任何支持的编辑器里跑起来,就像 LSP 让任何语言服务器能在任何编辑器里工作一样。你不再需要绑死在某个 IDE + 某个 AI Agent 的组合上了。 ...
快速认识 OpenClaw 是一个开源的、可本地部署的个人 AI 智能体(Personal AI Agent),它的前身是 ClawdBot 和 MoltBot。 其核心设计理念是“本地优先”(Local-first),它将 AI 的“大脑”即 Gateway(网关)控制平面运行在你自己的设备上。这意味着: ...