小语言模型 · 高效 AI · 开放模型

Phi-3 vs SmolLM2 vs MobileLLM 对比:小模型证明了什么

40 亿参数以下没有冠军:Phi-3 精选数据到 MMLU 69;SmolLM2 胜过 Llama3.2-1B 但数学输给 Qwen2.5-1.5B;MobileLLM 再涨 4.3%。

Phi-3 vs SmolLM2 vs MobileLLM 对比:小模型证明了什么

一句话结论

「最好的小语言模型」是个错误的问题,因为这一簇论文根本不在同一个擂台上比赛,它们回答的是三个不同的问题。Phi-3 问的是:精选数据能把一个装进口袋的模型推到多远。SmolLM2 问的是:把一个 1.7B 模型的整个训练流程全部公开会发生什么。MobileLLM 问的是:跌破十亿参数之后,架构设计还重要不重要。TinyLlama 则是更早的 1.1B 开放配方基线。四篇论文没有一篇在相同评测设置下跑过另外三篇的模型,所以任何跨模型对照表都是「四家各自的声明」并排陈列,而不是真刀真枪的对打。这恰恰是这篇对比值得写的原因:看点在于每个数字为什么会被生产出来,而不是给它们排名。

关键数字

指标Phi-3-miniSmolLM2(1.7B)MobileLLM(125M / 350M)TinyLlama(1.1B)
参数量3.8B1.7B125M / 350M1.1B
训练 token3.3T,过滤网页加合成数据约 11T,分四个阶段换配方未列出开放配方,本页未列 token 预算
头条声明MMLU 69,对比 GPT-3.5 的 68 和 Mixtral 8x7B 的 70.5通用基准全面胜过 Llama3.2-1B:HellaSwag 68.7 对 61.2、ARC 60.5 对 49.2、PIQA 77.6 对 74.8、MMLU-Pro 19.4 对 11.7较此前 125M / 350M 最优模型提升 2.7% 和 4.3%1.1B 量级的完全开放训练配方
明确记录的短板TriviaQA 等知识面广的测试明显偏弱GSM8K 31.1、MATH 11.6、HumanEval 22.6,全面低于 Qwen2.5-1.5B 的 61.7 / 34.3 / 37.2块级权重共享不加参数但增加延迟本页无可对照的榜单数字
指令跟随MT-bench 8.38(instruct 版)IFEval 56.7,Qwen2.5-1.5B 为 47.4聊天基准更强;API 调用任务上正确性接近 LLaMA-v2 7B未列出
端上声明4-bit 量化约 1.8GB,iPhone 14(A16)离线超过 12 token/秒另有 360M / 135M 变体(4T / 2T token)面向边缘设备面向十亿参数以下的端上延迟设计未列出
开放程度权重权重加 FineWeb-Edu(约 1.3T token)、FineMath(至多 54B)、Stack-Edu(约 125B、15 种语言)、SmolTalk未列出开放训练配方

表中每一行都来自对应论文在本站的页面;四篇论文互不同台,所以请把这张表读成四份声明的并排展示,而不是名次表。

配方一:精耕数据(Phi-3)

Phi-3 的架构毫无新意,就是标准的 Llama-2 式 transformer。它全部的赌注在于:大家耳熟能详的缩放定律,其实只是「喂未加筛选的互联网文本」造成的假象。一个 3.8B 模型,用 3.3 万亿条重度过滤的 token 加上合成「教科书级」数据训练,就能摸进 GPT-3.5 的地界:MMLU 69 分,而 GPT-3.5 是 68,Mixtral 8x7B 是 70.5;MT-bench 8.38。同样的配方在家族内部继续有效:phi-3-small(7B)和 phi-3-medium(14B)用 4.8T token 训练,MMLU 分别达到 75 和 78。

代价是这套配方你抄不走。过滤规则、合成数据的提示词、混合比例全部未公开,这可以理解,因为那才是护城河,所以这个声明靠的是榜单结果来支撑,而不是任何可复现的流程。论文自己对小容量的另一面也交代得很坦白:phi-3-mini 在 TriviaQA 这类知识问答上明显偏弱,多语言能力薄,作者甚至建议搭配搜索引擎使用。「媲美 GPT-3.5」指的是这些基准上的推理和聊天质量,不是知识的广度。

配方二:把整个流程公开(SmolLM2)

SmolLM2 做了完全相反的取舍。它是 Hugging Face 的 1.7B 模型,在约 11 万亿 token 上「超量训练」,远远越过算力最优点,它真正的贡献不是模型,而是配套文档:四个训练数据集全部公开。FineWeb-Edu(约 1.3T token,由在 Llama3-70B 标注上训练的分类器从 Common Crawl 里筛出的高教育价值网页)、FineMath(至多 54B token,分 10B 最高档和 34B 次档)、Stack-Edu(约 125B token、15 种语言的代码)、以及负责指令微调的 SmolTalk。你不仅能下载权重,还能重建整个数据配方。

训练被刻意分阶段:0 到 6T 是广义英文网页,6 到 8T 加入数学并提高代码占比,8 到 10T 换入更高质量的专业数据,10 到 11T 的退火阶段在上采样最好的数学和代码数据的同时降低学习率。它赌的是:模型「什么时候」看到什么数据,和「看到什么」一样重要。

通用推理的结果很干净:SmolLM2 在报告的每一项通用基准上都击败了 Meta 的 Llama3.2-1B,HellaSwag 68.7 对 61.2、ARC 60.5 对 49.2、PIQA 77.6 对 74.8、MMLU-Pro 19.4 对 11.7;instruct 版在 IFEval 上以 56.7 对 47.4 领先 Qwen2.5-1.5B。

SmolLM2 自己不想放在头条的那个数字

同样来自 SmolLM2 页面,它对 Qwen2.5-1.5B 的败仗也大得没法含糊:GSM8K 31.1 对 61.7、MATH 11.6 对 34.3、HumanEval 22.6 对 37.2。数学差不多只有一半,代码只有三分之二,而且是在相同基准上。SmolLM2 在通用推理均值上仍领先(HellaSwag 68.7 对 66.4、MMLU-Pro 19.4 对 13.7),所以诚实的总结是:广度和可复现性赢了,数学和代码输了。如果你的负载是 1.5B 量级的数学或代码生成,只开放权重的 Qwen 模型仍是更强的选择,尽管透明度这一仗 SmolLM2 赢得毫无争议。

配方三:重设计架构(MobileLLM)

MobileLLM 活动在一个数据配方不再是瓶颈的地方:十亿参数以下。在 125M 和 350M 这两个量级,论文主张小模型不是缩水版大模型:宽度昂贵且常被浪费,而深度和权重共享能用更少的参数换来更多推理步骤。设计取向是「深而窄」,层数更多、隐层更窄,配合嵌入共享和分组查询注意力(GQA)。报告的收益是相对此前 125M / 350M 最优水平提升 2.7% 和 4.3%;块级权重共享变体(MobileLLM-LS)在不加参数的前提下再提升 0.7% 和 0.8%,代价是一定延迟。

更重要的是这篇论文「没有」声明什么。它不追逐榜单极限,也不假装 350M 能替代 7B 去完成知识型任务。它面向部署的结果,更强的聊天基准、在 API 调用任务上接近 LLaMA-v2 7B 的正确性,恰好落在十亿以下模型唯一真正能部署的场景:窄、结构化、高频的端上任务。

TinyLlama:开放的基线

TinyLlama 处在 SmolLM2 同一条线的更早位置:1.1B 量级的完全开放训练配方。它在站上的页面记录的是规模和开放程度,而不是成页的榜单表格,所以它是「开放配方到底能做到多小」的参照点,而不是数字上的竞争者。可以把它读作后来者文化意义上的基线,哪怕没有同榜对打过。

怎么选

  • **要最强的口袋聊天模型,且能接受闭源数据流程:**phi-3-mini。3.8B 做到 MMLU 69、MT-bench 8.38,量化后约 1.8GB,iPhone 14 上离线超过 12 token/秒,是这一簇里「数据战胜规模」最强的单一证据。
  • **要审计、复现或重配数据:**毫不犹豫地选 SmolLM2。它是唯一训练全流程公开的条目,且全面胜过 Llama3.2-1B。
  • **负载是 1.5B 量级的数学或代码:**上面这些开放配方都赢不了。记住 Qwen2.5-1.5B 的 GSM8K 61.7 对 SmolLM2 的 31.1 就够了。
  • **跌破十亿参数或被端上延迟卡死:**只有 MobileLLM 把亚十亿架构当作研究问题本身,125M / 350M 上 2.7% 到 4.3% 的提升证明在那个量级设计仍然值钱。
  • **需要广博的事实知识:**都不行。phi-3 的论文自己标出 TriviaQA 短板;小容量是共同的天花板。

局限与存疑

这个对比结构性的局限在于没有公共评测台:phi-3 报 MMLU 和 MT-bench,SmolLM2 报 HellaSwag、ARC、PIQA、MMLU-Pro、GSM8K、MATH、HumanEval、IFEval,MobileLLM 报的是相对提升,基线模型本页并未点破。所以「69 对 68.7」这种跨模型数字即使都接近 70,也是毫无意义的。基准污染对每一篇靠精选数据吃饭的模型都是常年风险,而这一簇里只有 SmolLM2 让你能查看数据、自行推理污染的可能。另外四篇论文都早于当下这波 3B 以下推理模型的浪潮,所以把这篇当作「各训练配方证明了什么」的地图,而不是 2026 年的采购清单。

常见问题

最好的小语言模型是哪一款?

没有单一冠军,因为这些论文的初衷就不同。phi-3-mini 是精选数据的最强结果(3.8B、MMLU 69、MT-bench 8.38);SmolLM2 是最可复现的(1.7B、全部数据集公开);MobileLLM 是唯一为亚十亿端上场景而设计的。按部署场景和审计需求选,别按一个没人实测过的跨论文平均分选。

Phi-3-mini 真的和 GPT-3.5 一样好吗?

在它论文报告的基准上,接近:MMLU 69 对 GPT-3.5 的 68,MT-bench 8.38。但同一篇论文也坦白,3.8B 的容量装不下广博的事实知识,在问答类任务上偏弱。「一样好」指的是这些基准上的推理和聊天质量,不包括知识储备。

SmolLM2 打得过 Llama3.2-1B 吗?

在站内页面报告的所有通用推理基准上都赢:HellaSwag 68.7 对 61.2、ARC 60.5 对 49.2、PIQA 77.6 对 74.8、MMLU-Pro 19.4 对 11.7。但它没能在数学和代码上赢 Qwen2.5-1.5B(GSM8K 31.1 对 61.7)。

MobileLLM 为什么走「深而窄」而不是加宽?

在十亿参数以下,宽度昂贵且利用率低,而更深的层数和块级权重共享能用更少的参数换来更多推理步骤。论文报告相对此前最优提升 2.7% 和 4.3%,块级共享再贡献 0.7% 和 0.8%。

这些模型还做不到什么?

广博的事实知识是共同的天花板。phi-3 的论文自己标出 TriviaQA 偏弱并建议搭配搜索。1.5B 量级的数学和代码属于别的配方,SmolLM2 对 Qwen2.5-1.5B 的失利就是证据。而且上面每个分数都是各家自己评测设置下的基准声明,不是同台实测。