多模态模型 · Keye-VL 2.0 vs InternVideo3
Keye-VL 2.0 与 InternVideo3 对比:长上下文对小模型
Keye-VL 2.0 走稀疏注意力长上下文路线(LongVideoBench 74.1);InternVideo3 用 80 亿小模型加智能体回路(Video-MME +2.7)。
主题
开放权重模型及其背后的训练配方。
多模态模型 · Keye-VL 2.0 vs InternVideo3
Keye-VL 2.0 走稀疏注意力长上下文路线(LongVideoBench 74.1);InternVideo3 用 80 亿小模型加智能体回路(Video-MME +2.7)。
代码生成 · AlphaCode vs Code Llama
AlphaCode 用海量采样加筛选换来 Codeforces 前 54.3%;Code Llama 把开放权重做到 HumanEval 67%:两台机器干的是两件事。
小语言模型 · Phi-3 vs SmolLM2 vs MobileLLM vs TinyLlama
40 亿参数以下没有冠军:Phi-3 精选数据到 MMLU 69;SmolLM2 胜过 Llama3.2-1B 但数学输给 Qwen2.5-1.5B;MobileLLM 再涨 4.3%。
语言模型 · DeepSeek V4
DeepSeek V4 保留 V3 的 MoE,把注意力改为先压缩再稀疏,在双随机约束下加宽残差流,用 Muon 训练大多数矩阵;1M 下 KV 缓存只有 V3.2 的 10%。
语言模型 · Kimi K3
Kimi K3 三层 delta 规则线性注意力配一层全局 MLA,深度上对前置层做注意力,经半宽潜变量路由到 896 选 16 的专家;缩放效率约为 K2 的 2.5 倍。
语言模型 · Nemotron 3
Nemotron 3 Ultra 大多数层是 Mamba-2,注意力只有 2 个 KV 头,经潜变量路由到 512 选 22 的专家;解码比 GLM-5.1 快最多 5.9 倍。
语言模型 · Qwen3.8-Next
Qwen3.8-Flash-Next 激活 6B 参数;3:1 GDN 混合、稀疏注意力、门控残差和 Muon 以 1/9 FLOPs 追平 Qwen3.7-Plus。
DeepSeek-V4 发布 1.6T/49B 和 284B/13B 两个 MoE,用压缩稀疏与重度压缩注意力把 1M 上下文的 KV 缓存降到 V3.2 的 10%。
Kimi K3 是 2.8T 参数、104B 激活的 MoE,由 3:1 的 KDA 与门控 MLA、注意力残差和 896 专家 LatentMoE 构成,缩放效率为 K2 的 2.5 倍。
Moonshot 证明 Muon 加权重衰减和更新量缩放后,能以约一半算力达到 AdamW 的损失;5.7T token 训出的 16B MoE 模型 Moonlight 是证据。
英伟达 550B 总参数、55B 激活的 Mamba 注意力混合 MoE,NVFP4 下 20T token 预训练;以少几分精度换最高 5.9 倍解码吞吐。
Qwen3.8-Flash-Next 是 125B 参数、6B 激活的 MoE;GDN 混合、稀疏注意力、门控残差和 Muon 让它以 1/9 FLOPs 追平 Qwen3.7-Plus。
Kwai Keye-VL-2.0 是 30B-A3B 开放 MoE 多模态模型,支持 256K 上下文,在长视频、时间定位和代码智能体任务上表现突出。
小语言模型 · Independent Researcher
TinyLlama:开放小语言模型配方把开放小语言模型训练落到具体方法和可检查结果上,适合判断该方向的真实进展。
SmolLM2 是 1.7B 小模型,约 11T token 分四阶段过量训练。HellaSwag 68.7、MMLU-Pro 19.4 胜过 Llama3.2-1B,且四套数据集一起开源。
大模型推理 · Shanghai AI Laboratory
上海 AI 实验室的 30B-A3B 开源模型 SU-01,仅用约 33.8 万条短 SFT 轨迹加 200 步两阶段 RL,就在 IMO 2025 拿到 35 分金牌线。
Code Llama 在 Llama 2 上继续训练,HumanEval 最高 67%、MBPP 最高 65%,是发布时开放模型最好成绩,支持填空与 10 万 token 上下文。
DeepSeek-V3 是 6710 亿参数混合专家模型,每 token 仅激活 370 亿,全程训练只用 278.8 万 H800 GPU 时,比肩头部闭源模型且开源权重。
Gemma 是谷歌 DeepMind 从 Gemini 研究中提炼出的 2B 与 7B 开源权重模型,在 18 项文本任务中 11 项胜过同级开源模型,同时放出预训练与指令微调两套权重。
Llama 2 放出 7B、13B、70B 开放权重,外加 Llama 2-Chat——第一个把 RLHF 全流程(含独立安全奖励模型与 GAtt)写清楚的开源对话模型。
JetBrains 开源代码模型 Mellum 2:总参 12B、每 token 仅激活 2.5B 的混合专家,在软件任务上对标 4B-14B 稠密模型,算力却只够 2.5B。
Mistral 7B 是 70 亿参数的开源模型,在所有评测基准上都胜过 Llama 2 13B,靠分组查询注意力和滑动窗口注意力做到低成本推理,且以 Apache 2.0 协议开源。
Mixtral 每层从 8 个专家中只选 2 个,共 47B 参数、每 token 仅约 13B,以 Apache 2.0 开源,持平或超过 Llama 2 70B 和 GPT-3.5。
视觉-语言-动作 · Allen Institute for AI
MolmoAct2 是开源视觉-语言-动作栈,先在 3D 空间推理再动手。真实 DROID 成功率 87.1%,领先第二名 38.7 个点,推理模型 Molmo2-ER 还超过 GPT-5。
OpenSearch-VL 开源了数据、代码与权重,训练会调用真实搜索、OCR 和图像工具的视觉语言搜索智能体,30B-A3B 在七个基准上平均比 Qwen3-VL 基座提升 13.8 分。
Qwen2.5 是阿里开源大模型家族,覆盖 0.5B 到 72B,预训练 18T tokens,开源旗舰 72B-Instruct 比肩约大它 5 倍的 Llama-3-405B。
Meta 把 Llama 3 做成一个模型家族,旗舰是 405B 参数的稠密 Transformer,支持 128K 上下文,用 15 万亿以上 token 预训练,并公开了权重。