中文

难以置信竟无图像!仅使用语言监督学习视觉任务

计算机视觉与模式识别 2023-08-22 v4 计算与语言

摘要

计算机视觉任务所需的许多高层技能,如解析问题、比较与对比语义、撰写描述,在其他领域(如自然语言处理)中同样需要。本文中,我们探究是否可能从文本数据中学习这些技能,然后将其迁移到视觉任务,而从未在视觉训练数据上训练。我们方法的关键在于利用对比训练的视觉与语言编码器的联合嵌入空间。实践中,对比模型中不同模态的嵌入空间可能存在系统性差异,我们分析了这些差异如何影响我们的方法,并研究了缓解该问题的策略。我们仅使用文本训练数据在四项代表性任务上训练模型:图像描述、视觉蕴含、视觉问答和视觉新闻描述,并在使用图像的标准基准上评估它们。我们发现这些模型性能接近在图像上训练的模型,同时在纯文本设定下于描述与视觉蕴含任务上超越先前工作超过 9 分,并在视觉新闻上超越所有先前工作超过 30 分。我们还展示了一系列风格化图像描述模型,它们未使用任何图像数据与人工整理的语言数据训练,而是使用来自书籍、网络或语言模型的易获取文本数据。

关键词

引用

@article{arxiv.2211.09778,
  title  = {I Can't Believe There's No Images! Learning Visual Tasks Using only Language Supervision},
  author = {Sophia Gu and Christopher Clark and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2211.09778},
  year   = {2023}
}

备注

website (https://prior.allenai.org/projects/close), code (https://github.com/allenai/close)