EVIDENCE-BACKED PROJECT ARCHIVE · 2026-08-30

Tool-using code agent
RL, measured honestly.

基于 Harbor、rLLM、veRL 与 vLLM 构建的代码智能体强化学习工程,覆盖数据冻结、 容器化执行、GRPO、原生 critic/GAE PPO、checkpoint 评测与失败归因。

PROJECT QUESTION

强化学习是否真正提升了
工具调用代码智能体?

项目没有用训练 reward 或 critic loss 代替能力结论,而是冻结数据与执行协议, 对原始 SFT、父 PPO checkpoint 与后续 checkpoint 进行任务级配对评测。 最终统一 64K P0 未观察到稳定的总体增益。

SYSTEM ARCHITECTURE

训练与沙箱执行解耦

01

Frozen data

SWE-Smith 清洗、Oracle 验证、仓库平衡与固定切分。

02

Trainer

AutoDL 上的 rLLM + veRL,执行 GRPO 或 critic/GAE PPO。

03

Rollout

独立 vLLM 推理服务,支持权重同步与长上下文 agent 轨迹。

04

Sandbox

Harbor 调度隔离任务环境,通过测试产生 0/1 可验证奖励。

HarborrLLMveRLvLLMFSDPLoRAKubernetes

UNIFIED 64K P0

最终评测没有总体差异

相同 seed、上下文、Agent 配置和每题一次采样;按任务进行配对比较。

Frozen SWE-Smith test

38 tasks
Original SFT6/38

15.79%

=
Parent PPO6/38

15.79%

3 wins · 32 ties · 3 losses · McNemar p = 1.0

SWE-bench Verified

27 tasks
Original SFT9/27

33.33%

=
Parent PPO9/27

33.33%

2 wins · 23 ties · 2 losses · McNemar p = 1.0
!

更多计算没有转化为更多成功

Parent 在两个面板分别增加约 47.7% / 46.8% 的平均输入 token,运行时间约为 SFT 的 2.33 / 2.24 倍,但成功数没有增加。

TRAINING EVIDENCE

工程链路完成,能力门禁未通过

160第二轮 warm-start episodes
32训练期成功 episodes
12timeouts
166.6 MiB策略模型 LoRA 权重;完整策略检查点目录约 177.5 MiB
14.11 GiBcritic BF16 shards
−1.689最终 explained variance

训练成功中有 16/32 来自同一个 Pygments 任务。VF loss 降至约 0.0078,但 explained variance 仍为负,因此不能把优化器稳定运行解释为策略能力提升。

CURATED DOCUMENTATION

从结论回溯到实现

PUBLICATION BOUNDARY

这是实验档案,不是效果宣称

  • 不包含 `.env`、密钥、证书、Registry 密码或运行时状态。
  • 最终 267 题数据已上传至独立的 Harbor SWE-Smith 强化学习数据集,当前保持私有。
  • PPO 策略模型 LoRA 已上传至独立的 第 20 �­¥适配器模型仓库,当前保持私有;使用前需取得受访问门控基础模型的访问权限。
  • 云资源已释放,文档中的部署命令属于可复现的历史运行手册。