Kimi K3:2.8 万亿参数、百万上下文的开源混合专家模型
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
- 42 星/7日
- 16 引用
- 519 点赞
- #1 mathvision
榜单
总榜:最近 90 天的所有 AI 论文,涵盖语言模型、Agent、视觉、机器人等方向。按三路独立信号排序 —— 官方实现仓的涨星速度、引用数、Hugging Face 关注度 —— 只火一天的论文占不住位置。每天重排。
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。
手动搭的 agent 执行框架往往绑死某个领域,撑不起跨领域的长程任务。Raven 把「模型 + 执行框架」的组合当成可拼接的智能单元:Host Agent 负责拆目标、调度各专业子 agent 并合并结果;host archive 和 EverOS 把任务经验沉淀下来,再由 Skill Forge 提炼成可复用的流程。论文还给出在统一资源预算下扩大可靠任务覆盖面的充分条件。
这个 2.0 版本把游戏世界模型的互动时长拉到无限而不掉质量,靠的是精心设计的因果预训练范式;蒸馏出的实时版足以驱动 720p、60 帧的视频流;动作种类也大幅扩展,新增攻击、射箭、施法、射击等,并有更丰富的文本驱动交互元素。
这篇工作为双工语音模型设计了一套流式记忆架构:左脑负责事实信息,右脑负责情绪与个性化,让语音助手在实时对话中同时记住“你说了什么”和“你是怎么说的”。
Prime Agent 是一个开源的长程智能体框架:常驻 IPython 会话让模型用代码做测试时计算,历史、记忆、技能和子智能体配置可以跨任务保留,递归子智能体之间直接通信协作,人类还能随时查看和管理后台会话。
这篇技术报告升级了 LingBot-VLA:重构数据管线,用约 6 万小时预训练数据(20 种机器人本体共 5 万小时轨迹,外加 1 万小时第一人称人类视频),并把控制范围从双臂扩展到头部、腰部、移动底盘和灵巧手,目标直指实验室到真实部署之间的落地鸿沟。
反复自动修改智能体的 harness(提示词、控制流、工具、记忆)看似在自我进化,实则常常只是背熟了训练任务,一换基准就露馅。RRSI 给进化环的两端都加上正则:提案方在时间退火预算下工作、被鼓励走向没试过的路径;筛选方用 critic 挡掉针对特定基准的修改,用 pruner 剔除太小、太贵或已无用的编辑。论文称在进化所用划分上最多提升 14.1 分,在五个分布外基准上最多提升 4.7 分,且进化出的 harness 运行少用 30% 的 policy token。
小米机器人团队的视觉-语言-动作基础模型,用 10 万小时以上的真机 UMI 轨迹做预训练,并自动标注场景转换语言,再经后训练适配不同本体和人类的指令式提示。论文称数据量和参数量增加时性能持续提升,在新环境里可以开箱即用,灵巧任务上也能高效微调。
这篇工作给“递归自我改进”找了一个具体机制:系统记录每个用户回合预测的能力档位、实际路由到的服务层和交互结果,把这些记录经结构校验与六维语义评估后转成训练样本,保留交错推理、工具调用和 harness 上下文,驱动下一轮 agentic 后训练。
RoboDojo 是一个仿真与真机统一的机器人操作基准,用 42 个仿真任务加 18 个真机任务考察通用策略的泛化、记忆、精度和长程控制能力;附带并行 Isaac Sim 评测和云端真机评测系统,作者已用 30 个策略完成首轮集成榜单。
符号式音乐模型能显式规划作曲,但成品不像真正的录音;音频模型能生成整首歌,编曲逻辑却藏在里面。YuE2 把两者统一到单个 AR-NAR 混合 Transformer 架构里:先生成可读的乐谱,再展开成语义音乐 token,最后渲染成完整歌曲,并配套 MERT2、SheetSage2 两个表征模型,从没有对齐乐谱的录音中学习。论文称其在 WildSongBench 的 SongBench Global 平均得 6.73(best-of-8 为 6.96);专家盲听中 best-of-8 版本胜过 Suno v4.5、与 Suno v5 基本持平。生成的乐谱是可读的,外部语言模型 agent 可以直接按乐谱修改编曲。
物体离开画面后,视频生成模型还记得它存在吗?作者从认知科学出发造了 WROP:150 个任务横跨六类认知能力,用 Blender 渲染并在光照、速度、机位上随机扰动,产出 150 万条训练样本和一份 300 题的考试,用来考 14 个视频模型。他们还基于自研的 AWS Trainium2 原生 PyTorch 训练栈训出 160 亿参数的 PWM-WROP 世界模型,数据、考题、得分和权重全部开源。在盲评两两 Elo 对决中,它在续写类模型中排名第一,与最强的参考视频类模型基本打平。
这篇报告把“持续、可验证地推进真实工作”作为训练目标:一方面扩大可执行文件、搜索、代码环境的多样性与可验证性(环境扩展),另一方面训练智能体拆解长任务、并行委派、整合异步结果并随时重规划(协同扩展)。
LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。
这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。
Frontis-MA1 附带 OpenMLE 全栈开源系统(任务环境、强化学习算子学习、进化搜索),用来研究递归自我改进;其 350 亿参数元进化智能体围绕 Draft、Improve、Debug、Crossover 四类程序进化算子做后训练,作者称在 MLE-Bench Lite 上超过 GPT-5.5 加 Codex 的组合,组件还能迁移到没见过的 NatureBench Lite。
ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。
Dream-RSI 是一个让编程智能体自己改进“怎么探索”的框架:它把智能体过去的发现历程拼成一个回放模拟器,让探索策略在模拟器里低成本地演练迭代,再把练好的策略放回线上继续发现新解,形成递归自改进闭环。论文称在算法工程、数学优化和 GPU 内核三类任务上,它在保持或提升发现质量的同时,显著降低了部分场景下的发现成本。
通用视觉编码器没见过密集文字,直接套文档任务效果差。MonkeyOCRv2 构建了 1.13 亿张、17 语种的文档预训练语料,把图转文生成和像素级笔画重建结合起来联合预训练,让模型真正学会字符级的文档感知。
总榜:最近 90 天的所有 AI 论文,涵盖语言模型、Agent、视觉、机器人等方向。按三路独立信号排序 —— 官方实现仓的涨星速度、引用数、Hugging Face 关注度 —— 只火一天的论文占不住位置。每天重排。
短横线表示该路信号取不到,不代表数值为零。