Paper Reading Notes

Agentic RL 论文解读

Coding agent、长程智能体强化学习方向的论文精读与工程笔记。每篇都按原文结构拆解方法与实验,并单独标出哪些是原文结论、哪些是解读者的补充与存疑。

5篇论文解读
2篇工程笔记
2026-09-21最近更新

论文解读

Agentic Coding RL环境构造
CodeMidas:把源代码本身点成 RL 环境

不要 issue、不要 commit、不要已有测试——已实现的功能同时提供了任务定义、参考解和可执行验证器。3,185 个仓库 → 5,545 个可验证任务,五个 benchmark 全涨。

arXiv:2609.22068 · 小米 LLM Core 等 · 2026-09
Terminal Agent RLReward & Critic
T1:稠密奖励与满血 critic 的调稳过程

122B(A10B) MoE 放进真实 shell 沙箱跑 PPO,单任务 300+ 轮工具调用。最有信息量的不是榜单,而是怎么把逐条断言变成 reward、以及同尺寸 critic 怎么被调稳——包括没做成的尝试。

arXiv:2609.11042 · 腾讯混元 · 2026-09
Long-Horizon Agent上下文压缩
CompactionRL:把上下文压缩变成可训练的动作

长程 agent 迟早撞上上下文墙。常规做法是到墙边做一次摘要再开新窗口,但摘要本身从没被训练过。CompactionRL 把摘要 token 也塞进 RL 损失,与执行动作共享同一个任务奖励。

arXiv:2607.05378 · 清华大学 / Z.AI · 2026-07
Async RL价值模型
SAO:单轨迹异步优化

异步 RL 已经解决了「快」,但没解决「稳」和「好」。SAO 把 GRPO 的组内采样拆掉,用 DIS 双侧重要性采样 + 单轨迹 + 价值模型工程稳住异步训练。

arXiv:2607.07508 · 清华大学 · 2026-07
Post-trainingSFT → RL → OPD
DeepSeek-V4.1-Flash 的后训练

报告标题写的是 KV cache 压缩,但 §5 给出了更值得读的结论:在固定且平庸的优化算法下,数据与环境流水线的边际收益远高于后训练算法创新。全文按原文顺序拆解 §5。

技术报告 · DeepSeek · 2026

工程笔记

Fully Async Policy架构
Harbor × VeRL 全异步 RL 训练架构详解

从启动脚本到权重同步:一条样本如何走过 Rollouter、Agent Loop、Harbor 沙箱、轨迹 Proxy、MessageQueue,再进入 Trainer。

工程笔记
全异步 RL入门
把「全异步 RL」讲明白

从一张四宫格图出发,讲清 on-policy、流式 off-policy、异步陈旧样本、Partial Rollout 四种训练模式到底差在哪;再顺着一条样本的旅程走完全链路。

工程笔记 · 通俗版

原文链接:

各篇解读中的数值、图表均来自对应原文;解读者补充的分析与存疑在每篇页面底部单独声明。站点不托管论文 PDF,请通过上方链接访问原文。