主题

大模型推理

激发并提升大语言模型的逐步推理能力。

对比与解读

强化学习 · Self-distillation in RLVR vs Privileged-context teachers vs Dense token-level rewards

SDPG vs SDAR vs AntiSD:特权教师信号该怎么花

RLVR 一轨迹一比特。SDPG 在判对轨迹上照搬提示教师,SDAR 逐 token 门控照搬,AntiSD 奖励分歧而非照搬:同一特权教师信号的三种花法。