DINO:无标签训练视觉Transformer的秘密
摘要
DINO用自监督学生-教师框架,让视觉Transformer学会看懂图像,甚至自动分割物体。
❝“Student-teacher framework avoids model collapse by stabilizing training targets with slow teacher updates.”❞
深度解读
DINO:无标签训练视觉Transformer的秘密
一句话总结:DINO用自监督学生-教师框架,让视觉Transformer学会看懂图像,甚至自动分割物体。
内容概览
- 主题:视觉Transformer,自监督学习,学生-教师模型,图像嵌入,物体分割
- 适合人群:机器学习研究者、计算机视觉爱好者、AI工程师、NLP和视觉跨界创新者
核心观点
-
视觉Transformer能像BERT一样自监督预训练
DINO首次用自监督方法训练视觉Transformer,让模型不依赖人工标注,解决数据昂贵的问题。 -
学生-教师架构保持训练稳定,防止崩溃
教师网络缓慢更新,提供坚定目标,学生网络利用梯度反向传播学习两者概率分布的差异。 -
多尺度裁剪逼迫模型理解整体与细节,实现无监督分割
通过对图像多次局部和全局裁剪训练,模型被迫理解部分与整体的关系,自动生成语义分割效果。
深度解读
谁的标签都别想要:自监督学习是怎么让视觉Transformer不再“饿死”的
2020年,视觉Transformer(ViT)首次被提出。其架构和2017年的“Attention Is All You Need”Transformer差不多:将图像拆成一块块patch,通过编码器生成向量,最后用一个特殊的CLS向量进行图像分类。
缺点是什么?标签数据需求量惊人。ViT训练时,数据少就不如卷积神经网络,但数据多了,它能胜出。问题是,拿到那么多标注图片太烧钱了。
灵感来自NLP领域。BERT和GPT这些大语言模型,早已用无标签文本通过“自监督”预训练。比如,BERT随机遮盖一些单词,让模型猜被遮挡的内容。从纯文本中自动造标签,省钱又高效。
Facebook的研究团队想:视觉领域能不能也这么玩?答案是肯定的。DINO应运而生,训练ViT不再需要标签,只要原始图片即可。
学生和老师:装死的老师与拼命学习的学生
没有标签怎么办?DINO用了一招“学生-教师”结构。
- 学生网络和教师网络结构相同,参数初始时一样。
- 教师网络预测图像的“真实”标签(其实是概率分布),学生试图模仿这些结果。
- 学生通过梯度学习更新,老师“死板”得多,只用学生参数的滑动平均缓慢更新。
这样做是为了稳定训练,避免所谓“模式崩溃”,即只有极少数神经元被激活,其他完全没学到东西。
这里还有个细节:DINO输出层有多达65,000个维度,每一个代表“原型对象”(protoobjects)。没具体标签,拓展输出空间能给模型更多自由,帮它在无监督中自己寻找结构。
温度参数调节softmax的“锋利度”:老师输出分布非常尖锐,坚定告诉学生“这个物体属于这类”;学生输出分布更平缓,更易学习进步。
多尺度裁剪,逼学生“看全局”
训练时,输入的图像会被裁成10个小片段:2个“全局裁剪”,覆盖至少50%图像的大块,8个“局部裁剪”,只覆盖5%-50%区域。
老师只看全局裁剪,学生看全局+局部。这样,学生看到的是不同尺度和视角的图像片段,得学会把部分片段关联到整体上。
训练目标就是让学生预测这些片段对应的同一对象。过程强迫网络学会:
- 把图像局部区域聚合成整体的表征
- 理解局部和整体对象的关系
结果令人惊讶——尽管训练中没有用过分割标注,模型内部自动学会了物体的分割!也就是说,它能把背景和物体区分开,给每个物体找到边界。
CLS向量:小小的令牌承载了图像的全信息
视觉Transformer的核心输出是这个CLS向量。它代表了整张图像的全局表征:类似BERT中的[CLS]标记,捕捉语句的整体含义。
研究者发现:
- CLS向量对图像的描述非常丰富,能用于相似图像搜索,表现优异。
- 观察多头注意力矩阵后,可以可视化CLS对所有patch的关注程度,发生物体自动分割。
这里还有个简单比喻:学生看到一张狗的不同部分(耳朵、鼻子、眼睛),不能只认部分,要把它们归为整体“狗”。通过不断训练,模型“知道”这些局部是一个整体,也就学会了分割。
训练细节与推理流程解析
每张图片先被拆成8x8的patch,每个patch变成192维的向量,再映射到Transformer预期的维度。给patch加上位置编码,插入CLS token,整体输入Transformer。
Transformer经过多层多头自注意力机制,计算各patch间的关系,最后输出一组新的patch向量和一个CLS向量。
训练时用交叉熵计算学生和教师对相同裁剪的预测概率分布差距,反向传播只针对学生和MLP层,教师参数则用滑动平均更新。
推理时,选学生或教师网络都可以,他们权重趋近一致。取CLS向量作为图像的“向量表示”,方便做检索或分类。
值得记住的话
“Student-teacher framework avoids model collapse by stabilizing training targets with slow teacher updates.”
“Multi-crop input forces the model to relate parts to entire objects, naturally emerging segmentation without explicit labels.”
“When large output dimensions represent proto-object concepts, the model can discover meaningful image structures autonomously.”
标签
AI 视觉Transformer 自监督学习 学生教师模型 计算机视觉
更多值得记住的话
“Multi-crop input forces the model to relate parts to entire objects, naturally emerging segmentation without explicit labels.”
“When large output dimensions represent proto-object concepts, the model can discover meaningful image structures autonomously.”