【内涵】Learning Transferable Visual Models From Natural Language Supervision

【内涵】Learning Transferable Visual Models From Natural Language Supervision 大家一般将这篇文章代指为CLIP但是感觉CLIP是一种what而没有揭示出why其实这样不太好容易忘记文章的原本真正想表达的东西。这篇文章的最大的启发或者说洞见是一种通过language(具体来讲是image caption)来作为监督信号来学习Transferable的视觉模型。在AI1.0时代基于imagenet的分类模型充当了这一个transferable的视觉模型因为在检测、分割等下游任务上一般都会将其作为pretrian模型而大家确实也发现定性来看分类pretrian模型学习到一些边缘、纹理这种通用的视觉特征定量来看有pretrain模型可以极大的提升下游的检测和分类任务。而这篇则是对基于imagenet的分类pretrain模型的角色替代一方面监督信息是caption回包含更多的信息另外一方面从效果上来看该模型不单单是提升下游任务的指标甚至具备了one shot的能力。