Coding agent、长程智能体强化学习方向的论文精读与工程笔记。每篇都按原文结构拆解方法与实验,并单独标出哪些是原文结论、哪些是解读者的补充与存疑。
不要 issue、不要 commit、不要已有测试——已实现的功能同时提供了任务定义、参考解和可执行验证器。3,185 个仓库 → 5,545 个可验证任务,五个 benchmark 全涨。
122B(A10B) MoE 放进真实 shell 沙箱跑 PPO,单任务 300+ 轮工具调用。最有信息量的不是榜单,而是怎么把逐条断言变成 reward、以及同尺寸 critic 怎么被调稳——包括没做成的尝试。
长程 agent 迟早撞上上下文墙。常规做法是到墙边做一次摘要再开新窗口,但摘要本身从没被训练过。CompactionRL 把摘要 token 也塞进 RL 损失,与执行动作共享同一个任务奖励。
异步 RL 已经解决了「快」,但没解决「稳」和「好」。SAO 把 GRPO 的组内采样拆掉,用 DIS 双侧重要性采样 + 单轨迹 + 价值模型工程稳住异步训练。
报告标题写的是 KV cache 压缩,但 §5 给出了更值得读的结论:在固定且平庸的优化算法下,数据与环境流水线的边际收益远高于后训练算法创新。全文按原文顺序拆解 §5。
从启动脚本到权重同步:一条样本如何走过 Rollouter、Agent Loop、Harbor 沙箱、轨迹 Proxy、MessageQueue,再进入 Trainer。
从一张四宫格图出发,讲清 on-policy、流式 off-policy、异步陈旧样本、Partial Rollout 四种训练模式到底差在哪;再顺着一条样本的旅程走完全链路。
原文链接:
各篇解读中的数值、图表均来自对应原文;解读者补充的分析与存疑在每篇页面底部单独声明。站点不托管论文 PDF,请通过上方链接访问原文。