主题

AI 智能体

由大模型驱动、能规划、行动、调用工具并携带技能的系统。

深色屏幕上的自主智能体工作流

对比与解读

强化学习 · Self-distillation in RLVR vs Privileged-context teachers vs Dense token-level rewards

SDPG vs SDAR vs AntiSD:特权教师信号该怎么花

RLVR 一轨迹一比特。SDPG 在判对轨迹上照搬提示教师,SDAR 逐 token 门控照搬,AntiSD 奖励分歧而非照搬:同一特权教师信号的三种花法。

AI 智能体把大模型套进规划、工具调用、记忆与行动的循环里,让只能一问一答的模型变成能跨多步追求目标的系统。真正重要的研究,不在于某个具体模型,而在于智能体如何推理、调用工具、从错误中恢复,并在任务之间携带可复用的技能。

这个主题记录了从巧妙提示到持久基础设施的转变:ReAct 把推理与行动交织,Toolformer 教模型调用 API,而 COLLEAGUE.SKILL 这类技能打包系统把专长变成可移植、可纠正的产物。真正的难题在可靠性、评测、安全边界,以及如何大规模地编写和维护技能。

奠基论文

近期解读