Back
第八章:`eval.py`——Base/checkpoint 统一评测
笔记
第七章:`train.py`——轨迹到 PPO 张量
第六章:`rollout.py`——多轮轨迹状态机
第五章:`reward.py`——最终答案与稀疏奖励
第四章:`sandbox.py`——代码调用如何变成 observation
第三章:`protocol.py`——消息、文本与 token 边界