榜单

大模型论文精选

最近 90 天的大模型论文,按三路独立信号排序:官方实现仓在 GitHub 上的涨星速度、论文被引用的次数、以及在 Hugging Face 上获得的关注。只有单路信号突出的论文不进榜。每天重排。

统计窗口: 2026-07-04 – 2026-10-01 榜单更新于 2026-10-02

3

NeoHorse-1:把每次对话的路由记录变成下一轮训练数据的自我进化模型

这篇工作给“递归自我改进”找了一个具体机制:系统记录每个用户回合预测的能力档位、实际路由到的服务层和交互结果,把这些记录经结构校验与六维语义评估后转成训练样本,保留交错推理、工具调用和 harness 上下文,驱动下一轮 agentic 后训练。

  • 464 星/7日
  • 0 引用
  • 407 点赞
  • #1 tau2-bench
4

LingBot-VLA 2.0:6 万小时、20 种本体数据预训练的视觉-语言-动作模型

这篇技术报告升级了 LingBot-VLA:重构数据管线,用约 6 万小时预训练数据(20 种机器人本体共 5 万小时轨迹,外加 1 万小时第一人称人类视频),并把控制范围从双臂扩展到头部、腰部、移动底盘和灵巧手,目标直指实验室到真实部署之间的落地鸿沟。

  • 32 星/7日
  • 15 引用
  • 21 点赞
  • #3 robotwin-2-0-easy-50-tasks
5

YuE2:先写出可读的乐谱、再据此渲染成完整歌曲音频的统一音乐生成模型

符号式音乐模型能显式规划作曲,但成品不像真正的录音;音频模型能生成整首歌,编曲逻辑却藏在里面。YuE2 把两者统一到单个 AR-NAR 混合 Transformer 架构里:先生成可读的乐谱,再展开成语义音乐 token,最后渲染成完整歌曲,并配套 MERT2、SheetSage2 两个表征模型,从没有对齐乐谱的录音中学习。论文称其在 WildSongBench 的 SongBench Global 平均得 6.73(best-of-8 为 6.96);专家盲听中 best-of-8 版本胜过 Suno v4.5、与 Suno v5 基本持平。生成的乐谱是可读的,外部语言模型 agent 可以直接按乐谱修改编曲。

  • 437 星/7日
  • 0 引用
  • 216 点赞
6

小米机器人一号:10 万小时以上真机轨迹预训练的视觉-语言-动作模型

小米机器人团队的视觉-语言-动作基础模型,用 10 万小时以上的真机 UMI 轨迹做预训练,并自动标注场景转换语言,再经后训练适配不同本体和人类的指令式提示。论文称数据量和参数量增加时性能持续提升,在新环境里可以开箱即用,灵巧任务上也能高效微调。

  • 9 星/7日
  • 15 引用
  • 75 点赞
  • #3 robocasa
7

WROP:用认知科学考题测视频世界模型懂不懂客体永存,并训出一个能考过的 160 亿参数模型

物体离开画面后,视频生成模型还记得它存在吗?作者从认知科学出发造了 WROP:150 个任务横跨六类认知能力,用 Blender 渲染并在光照、速度、机位上随机扰动,产出 150 万条训练样本和一份 300 题的考试,用来考 14 个视频模型。他们还基于自研的 AWS Trainium2 原生 PyTorch 训练栈训出 160 亿参数的 PWM-WROP 世界模型,数据、考题、得分和权重全部开源。在盲评两两 Elo 对决中,它在续写类模型中排名第一,与最强的参考视频类模型基本打平。

  • 409 星/7日
  • 0 引用
  • 193 点赞
9

Frontis-MA1:开源的 350 亿“元进化”智能体,递归改进自己的机器学习工程

Frontis-MA1 附带 OpenMLE 全栈开源系统(任务环境、强化学习算子学习、进化搜索),用来研究递归自我改进;其 350 亿参数元进化智能体围绕 Draft、Improve、Debug、Crossover 四类程序进化算子做后训练,作者称在 MLE-Bench Lite 上超过 GPT-5.5 加 Codex 的组合,组件还能迁移到没见过的 NatureBench Lite。

  • 26 星/7日
  • 3 引用
  • 186 点赞
13

Spark-to-Paper:在现有编程助手里把选题、实验、成稿串成十三个可组合技能

从想法到成稿不只是写字。Spark-to-Paper 不搭新平台,而是在现有编程助手里实现十三个可组合技能:检索文献、设计与执行实验、按证据修正结论、产出出版级图表,并把模型判断和可机械验证的操作分开,实验规划与报告撰写也相互独立。

  • 73 星/7日
  • 0 引用
  • 291 点赞
14

TurboVLA:不用 LLM 当中枢,消费级显卡上以约 32 Hz 实时跑视觉-语言-动作模型

主流 VLA 方案要把视觉观测投影进大语言模型的表征空间再解码动作,每次决策都很重。TurboVLA 不走这条路:视觉与语言各自独立编码,经一个轻量双向交互模块交换信息,再由紧凑解码器直接输出连续动作块。作者称这个仅 0.2B 参数的策略在 LIBERO 上平均成功率 97.7%,在 RTX 4090 上推理延迟 31.2 毫秒、显存不到 1 GB,为小算力机器人控制器提供了一个不用 LLM 做中枢的简单替代。

  • 86 星/7日
  • 0 引用
  • 140 点赞
15

LimiX-2:不只会预测、还学数据生成机制的表格基础模型

LimiX-2 是一个表格基础模型,核心是“情境机制网络”:传统表格 PFN 的目标是在给定上下文表格后预测标签,它改为学习数据生成本身的联合结构,也就是同时建模特征和标签是如何一起被生成的。模型用结构因果模型批量合成的数据集做预训练,配合情境条件掩码建模。论文称在 TabArena、TALENT、BCCO 三个基准上都超过了专用模型和现有表格基础模型;由于训练目标是学机制,它的特征注意力顺带编码了直接因果关系,可以直接用来做因果骨架恢复。

  • 57 星/7日
  • 0 引用
  • 188 点赞

这个榜怎么排的

最近 90 天的大模型论文,按三路独立信号排序:官方实现仓在 GitHub 上的涨星速度、论文被引用的次数、以及在 Hugging Face 上获得的关注。只有单路信号突出的论文不进榜。每天重排。

短横线表示该路信号取不到,不代表数值为零。