AI Agent 论文精选

AI Agent 论文精选 · 2026-W38

统计窗口: 2026-06-22 – 2026-09-19 冻结于 2026-09-20

2

FreeToken:把个人电脑当成弹性推理平台,本地跑大型 MoE 模型

开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。

  • 627 星/7日
  • 2 引用
  • 109 点赞
5

Dream-RSI:让编程智能体在回放模拟器里离线自我改进探索策略的框架

Dream-RSI 是一个让编程智能体自己改进“怎么探索”的框架:它把智能体过去的发现历程拼成一个回放模拟器,让探索策略在模拟器里低成本地演练迭代,再把练好的策略放回线上继续发现新解,形成递归自改进闭环。论文称在算法工程、数学优化和 GPU 内核三类任务上,它在保持或提升发现质量的同时,显著降低了部分场景下的发现成本。

  • 900 星/7日
  • 0 引用
  • 270 点赞
6

ABot-World-0:单张台式机显卡实时流式运行的动作条件世界模型

ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。

  • 16 星/7日
  • 6 引用
  • 313 点赞
8

Atria Dawn:用可验证经验训练、面向科研工作流的智能体基础模型

Atria Dawn 是一个面向科研与工程工作流的智能体基础模型。它的训练管线把工具调用挂到可执行环境和可外部核验的结果上,让模型的经验来自真实任务的验证反馈;论文还结合 56 名研究者使用过程中的 769 条任务记录,分析了人机协作中人和智能体各自的分工。

  • 509 星/7日
  • 0 引用
  • 421 点赞
9

OSWorld 2.0:108 个长程真实电脑操作任务,最强智能体也只完成两成

OSWorld 2.0 是 xlang-ai 团队推出的电脑操作智能体基准,用 108 个基于真实文件、带用户状态的长程工作流任务取代此前的短脚本任务,人类完成一道题的中位数约 1.6 小时。结果相当扎心:表现最好的 Claude Opus 4.8 也只能完成 20.6% 的任务,常常在跟踪约束和结果验证上掉链子。

  • 20 星/7日
  • 15 引用
  • 25 点赞
10

LLM-as-a-Verifier:不问裁判式打分,直接从打分 token 读出连续验证分数

LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。

  • 33 星/7日
  • 11 引用
  • 19 点赞
11

ZGCM-1:完全开源的 7B 模型,把长推理与工具调用结合用于数学和智能体搜索

ZGCM-1 是一个完全开源的 7B 稠密基础模型,主攻数学推理和智能体搜索。它的核心思路是:小模型背不下整个网络,就把长时间的内部推理和主动调用外部工具结合起来——架构上采用门控滑窗与全注意力交错,训练上配合 FP8 Muon 优化器和从 16K 逐步扩到 256K 的课程式训练。论文称已分阶段放出权重、训练代码、各阶段数据配方和 W&B 日志。

  • 475 星/7日
  • 0 引用
  • 300 点赞
12

智能体自我改进综述:基础模型加脚手架,怎样把经验变成能力积累

这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。

  • 21 星/7日
  • 9 引用
  • 35 点赞
13

SoL-Pi:让自动化研究循环自我演化,把编程智能体的外壳做得更省 token

SoL-Pi 把递归自我改进用在智能体的运行外壳上而不是模型本身:一个自动化研究循环在多样环境里自行演化出动作执行、上下文压缩、观察处理和委托阅读四类可复用机制。作者在 51 题的 EdgeBench 基准上报告,它在与 Pi 相当的性能下把记录的 token 流量减少 44.7%-49.0%,API 成本约降三分之一。

  • 975 星/7日
  • 0 引用
  • 66 点赞

本周 · AI Agent 论文精选