Frozen data
SWE-Smith 清洗、Oracle 验证、仓库平衡与固定切分。
EVIDENCE-BACKED PROJECT ARCHIVE · 2026-08-30
基于 Harbor、rLLM、veRL 与 vLLM 构建的代码智能体强化学习工程,覆盖数据冻结、 容器化执行、GRPO、原生 critic/GAE PPO、checkpoint 评测与失败归因。
PROJECT QUESTION
项目没有用训练 reward 或 critic loss 代替能力结论,而是冻结数据与执行协议, 对原始 SFT、父 PPO checkpoint 与后续 checkpoint 进行任务级配对评测。 最终统一 64K P0 未观察到稳定的总体增益。
SYSTEM ARCHITECTURE
SWE-Smith 清洗、Oracle 验证、仓库平衡与固定切分。
AutoDL 上的 rLLM + veRL,执行 GRPO 或 critic/GAE PPO。
独立 vLLM 推理服务,支持权重同步与长上下文 agent 轨迹。
Harbor 调度隔离任务环境,通过测试产生 0/1 可验证奖励。
UNIFIED 64K P0
相同 seed、上下文、Agent 配置和每题一次采样;按任务进行配对比较。
15.79%
15.79%
33.33%
33.33%
Parent 在两个面板分别增加约 47.7% / 46.8% 的平均输入 token,运行时间约为 SFT 的 2.33 / 2.24 倍,但成功数没有增加。
TRAINING EVIDENCE
训练成功中有 16/32 来自同一个 Pygments 任务。VF loss 降至约 0.0078,但 explained variance 仍为负,因此不能把优化器稳定运行解释为策略能力提升。
CURATED DOCUMENTATION
PUBLICATION BOUNDARY