中文

标题监督造就鲁棒的学习器

计算机视觉与模式识别 2022-12-09 v2

摘要

像 CLIP 这样的视觉语言(VL)模型对自然分布偏移具有鲁棒性,部分原因是 CLIP 使用一种称为标题监督(caption supervision)的技术在非结构化数据上学习;该模型将图像关联文本解释为真实标签。在一项精心控制的对比研究中,我们表明,在标准交叉熵损失下训练的标题监督 CNN(通过扫描标题中的类名来分配图像标签)可以表现出比在相同数据上训练的 VL 模型更强的分布鲁棒性。为促进未来使用高精度标题监督模型的实验,我们引入了 CaptionNet(https://github.com/penfever/CaptionNet/),其包含一个类平衡、全监督的数据集,具有超过 50,000 个新的人工标注的 ImageNet 兼容样本,并包含网络抓取的标题。在 CaptionNet 上的一系列实验中,我们展示了损失函数、数据过滤和监控策略的选择如何实现鲁棒的计算机视觉。我们还提供了在 VL Hub(https://github.com/penfever/vlhub/)上复现实验所需的代码库。

关键词

引用

@article{arxiv.2210.07396,
  title  = {Caption supervision enables robust learners},
  author = {Benjamin Feuer and Ameya Joshi and Chinmay Hegde},
  journal= {arXiv preprint arXiv:2210.07396},
  year   = {2022}
}