主题

强化学习

用奖励训练语言模型与智能体——RLHF、RLVR、GRPO 与可验证奖励等推动推理能力提升的方法。

对比与解读

强化学习 · Self-distillation in RLVR vs Privileged-context teachers vs Dense token-level rewards

SDPG vs SDAR vs AntiSD:特权教师信号该怎么花

RLVR 一轨迹一比特。SDPG 在判对轨迹上照搬提示教师,SDAR 逐 token 门控照搬,AntiSD 奖励分歧而非照搬:同一特权教师信号的三种花法。