Agent 造的游戏,怎么自动评测?

本文基于 tongxuluo/gamecraft-bench 的源码(论文 arXiv:2606.17861),讲清"轨迹回放 + 多模态评分"这条链路是怎么设计的。 一、它是什么 GameCraft-Bench 测的是:coding agent 能不能把一段自然语言游戏规格,变成一个完整可玩的 Godot 项目。140 个任务,覆盖 15 个游戏门类(平台跳跃、策略、塔防、Roguelike、视觉小说……),跑在 Harbor 框架上,并自带一个 Docker-less 的本地子进程环境。 ...

2026-06-24 · 30 分钟 · 5437 字 · cjraft

Harbor Framework 调研:Agent Eval & RL Roullout

写作背景 下午听了一个关于 Harbor 的分享, 正好和手头做的 Eval Harness 的事情相关, 就做一下深入了解, 也许能得到有价值的输入。 目前很多社区工具 or 框架都可以用来做 rollout、 eval 的事,但各自的关注点不同, 比如 SWE-agent, 它更像一个 coding agent scaffold, 专心跑产物; SWE-bench harness 则专注 patch 评测工具; 而本文分析的 Harbor 更像把任务、沙箱、Agent、verifier、reward 和指标聚合串起来的外层执行框架, 该框架由 Terminal-Bench 团队推出,GitHub:harbor-framework/harbor ...

2026-06-05 · 34 分钟 · 6145 字 · cjraft