CLIP(Contrastive Language-Image Pre-training)是由OpenAI开发的一个深度学习模型,用于处理图像和文本之间的语义关系。CLIP通过对图像和文本进行联合训练,学习到了一个通用的表示空间,使得相似的图像和文本在这个空间中距离较近,而不相似的则距离较远。
监督学习的局限性
由图像分类模型生成的现成特征已被用于图像检索等其他任务中。
但是,这些特征的通用性不强,
因为分类模型是为识别一组固定的类别而训练的。
要在这组类别中添加任何新类别,
都需要为这一新类别收集额外的标注图像,
然后重新训练模型。
这是一个耗时且昂贵的过程。
能否利用自监督学习技术来解决这一问题?
能否利用图像说明来生成更好的图像表征并避免标注成本? 也就是说,能否使用自然语言作为监督来学习视觉感知?
主要贡献
作者提出了一项预训练任务(CLIP = Contrastive Language Pre-training),
- 即预测哪张图片配哪句标题,以便从头开始学习SOTA图像表征。
为此,他们创建了一个从互联网上收集的包含4亿个(图片、文本)配对的数据集:
- 这种预先训练好的模型可以不费吹灰之力地应用到大多数任务中
- 而且不需要任何特定数据集的训练,就能与完全有监督的基线模型相媲美。