中文

LocTex:从局部化文本监督中学习数据高效的视觉表示

计算机视觉与模式识别 2021-08-27 v1 计算与语言

摘要

目标检测与语义/实例分割等计算机视觉任务依赖于对大型训练数据集的费力标注。本文提出LocTex,利用低成本的局部化文本标注(即图像描述与同步鼠标悬停手势)来减少标注工作量。我们引入了图像与描述之间的对比预训练框架,并提议用渲染的鼠标轨迹监督跨模态注意力图以提供粗粒度定位信号。我们学到的视觉特征捕获了丰富语义(来自自由形式描述)与准确定位(来自鼠标轨迹),在迁移到各类下游视觉任务时非常有效。与ImageNet监督预训练相比,LocTex可将预训练数据集规模缩减10倍或将目标数据集缩减2倍,同时在COCO实例分割上取得可比甚至更优的性能。在提供相同数量标注时,LocTex在PASCAL VOC图像分类任务上比先前最优的“视觉+语言”预训练方法准确率高出约4%。

关键词

引用

@article{arxiv.2108.11950,
  title  = {LocTex: Learning Data-Efficient Visual Representations from Localized Textual Supervision},
  author = {Zhijian Liu and Simon Stent and Jie Li and John Gideon and Song Han},
  journal= {arXiv preprint arXiv:2108.11950},
  year   = {2021}
}

备注

ICCV 2021. Project page: https://loctex.mit.edu/