自监督学习 · SimCLR vs BYOL vs MAE vs DINOv2
SimCLR、BYOL、MAE、DINOv2 对比:冻结特征还是微调
SimCLR 负样本大 batch 到 69.3;BYOL 去负样本 74.3 且小 batch 稳;MAE 微调 87.8 冻结崩;DINOv2 冻结 86.3 超 OpenCLIP。
主题
在没有特定任务标签的情况下从数据中学习通用表征的训练方法。
自监督学习 · SimCLR vs BYOL vs MAE vs DINOv2
SimCLR 负样本大 batch 到 69.3;BYOL 去负样本 74.3 且小 batch 稳;MAE 微调 87.8 冻结崩;DINOv2 冻结 86.3 超 OpenCLIP。
ByG 不用任何配对数据、不用奖励模型,训练图像与视频编辑模型;视频两两对比中以 75.3% 胜率击败用数百万配对训练的 Ditto。
BYOL:没有负样本的自监督学习把无负样本自监督视觉学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
MAE 随机遮住 75% 图像块只重建像素,让微调后的 ViT-Huge 仅用 ImageNet-1K 就拿到 87.8% top-1,预训练还快约 3 倍。
SimCLR:对比学习视觉表征把对比式视觉表征学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
SimCSE:对比学习句向量把对比式句向量学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
DINOv2 用无标签自监督在精选的 1.42 亿张图上预训练 ViT,骨干冻结后只加一个线性探针,就能在多数图像级与像素级基准上追平甚至超过 OpenCLIP。
GENEB 用统一探针协议,在 13 类共 100 个任务上评测 40 个基因组基础模型的冻结表征,发现排名跨类别剧烈翻转,堆参数只换来微弱且不稳定的提升。
Mega-ASR 用 240 万条仿真音频、54 种复合声学场景训练 Qwen3-ASR-1.7B,把 VOiCES R4-B-F 上的词错率从 54.01% 降到 45.69%。