榜单

AI Agent 论文精选

最近 90 天的 Agent 论文 —— 工具调用、计算机操作、编程 Agent、多智能体系统。按三路独立信号排序:官方实现仓的涨星速度、引用数、Hugging Face 关注度。只有单路信号突出的论文不进榜。每天重排。

统计窗口: 2026-07-04 – 2026-10-01 榜单更新于 2026-10-02

1

FreeToken:把个人电脑当成弹性推理平台,本地跑大型 MoE 模型

开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。

  • 348 星/7日
  • 2 引用
  • 109 点赞
3

Raven:自动构建、进化和编排 agent 执行框架的开源多智能体生态

手动搭的 agent 执行框架往往绑死某个领域,撑不起跨领域的长程任务。Raven 把「模型 + 执行框架」的组合当成可拼接的智能单元:Host Agent 负责拆目标、调度各专业子 agent 并合并结果;host archive 和 EverOS 把任务经验沉淀下来,再由 Skill Forge 提炼成可复用的流程。论文还给出在统一资源预算下扩大可靠任务覆盖面的充分条件。

  • 1,007 星/7日
  • 0 引用
  • 493 点赞
5

RRSI:给智能体 harness 的递归自我改进加上正则,让进化出的机制扛得住分布外基准

反复自动修改智能体的 harness(提示词、控制流、工具、记忆)看似在自我进化,实则常常只是背熟了训练任务,一换基准就露馅。RRSI 给进化环的两端都加上正则:提案方在时间退火预算下工作、被鼓励走向没试过的路径;筛选方用 critic 挡掉针对特定基准的修改,用 pruner 剔除太小、太贵或已无用的编辑。论文称在进化所用划分上最多提升 14.1 分,在五个分布外基准上最多提升 4.7 分,且进化出的 harness 运行少用 30% 的 policy token。

  • 843 星/7日
  • 0 引用
  • 172 点赞
6

LLM-as-a-Verifier:不问裁判式打分,直接从打分 token 读出连续验证分数

LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。

  • 24 星/7日
  • 11 引用
  • 19 点赞
7

智能体自我改进综述:基础模型加脚手架,怎样把经验变成能力积累

这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。

  • 19 星/7日
  • 9 引用
  • 35 点赞
9

ABot-World-0:单张台式机显卡实时流式运行的动作条件世界模型

ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。

  • 6 星/7日
  • 6 引用
  • 313 点赞
10

Dream-RSI:让编程智能体在回放模拟器里离线自我改进探索策略的框架

Dream-RSI 是一个让编程智能体自己改进“怎么探索”的框架:它把智能体过去的发现历程拼成一个回放模拟器,让探索策略在模拟器里低成本地演练迭代,再把练好的策略放回线上继续发现新解,形成递归自改进闭环。论文称在算法工程、数学优化和 GPU 内核三类任务上,它在保持或提升发现质量的同时,显著降低了部分场景下的发现成本。

  • 173 星/7日
  • 0 引用
  • 270 点赞
13

Ouroboros:靠“经评审的提交”重写自身工具与核心代码的编程智能体

Ouroboros 是一个自我迭代的编程智能体框架:工具、提示词、上下文组装乃至核心实现都通过“经评审的提交”逐步进化,并成为后续运行的基础,支持递归自由进化和经验驱动核心进化两种模式。作者还报告了长达 161 天、横跨七个人类交流界面的真实部署,强调当智能体开始重写自己时,安全护栏必须始终保持最高权威。

  • 25 星/7日
  • 2 引用
  • 92 点赞
  • #1 osworld-verified
14

EvoOntology:以 MCP 服务器承载的自进化本体层,补上数据智能体与异构数据之间的语义鸿沟

数据智能体只能透过通用工具看到列名和文件路径,看不到数据本身的含义,这就是 agent-data 鸿沟。EvoOntology 把本体(schema、内容、工具三层)封装成一个 MCP 服务器,让智能体运行时可以主动查询;构建由 builder 智能体自动完成,之后通过归因引导的编辑持续进化,每处修改都要经过与 backbone 对照的成对评估才被接受。论文称在三个数据智能体基准、四个 LLM backbone 上稳定优于强基线和手工语义层方案。

  • 164 星/7日
  • 0 引用
  • 126 点赞

这个榜怎么排的

最近 90 天的 Agent 论文 —— 工具调用、计算机操作、编程 Agent、多智能体系统。按三路独立信号排序:官方实现仓的涨星速度、引用数、Hugging Face 关注度。只有单路信号突出的论文不进榜。每天重排。

短横线表示该路信号取不到,不代表数值为零。