中文

从网络爬取的图像-文本数据中学习噪声感知以用于图像描述

计算机视觉与模式识别 2023-09-28 v2 人工智能

摘要

图像描述是直接可利用大规模网络爬取数据的任务之一,此类数据为描述模型提供了关于视觉世界的丰富知识。然而,由于网络爬取数据包含在不同层次上对齐的图像-文本对,其固有噪声(例如未对齐的对)使得学习精确的描述模型变得困难。虽然过滤策略能有效去除噪声数据,但会导致可学习知识的减少,并有时引发数据匮乏的新问题。为兼得二者之长,我们提出噪声感知描述(NoC)框架,从整个网络爬取数据中学习丰富知识,同时较少受噪声影响。这通过所提出的对齐级别可控描述器实现,该描述器在训练中以图像-文本对的对齐级别作为控制信号进行学习。对齐级别条件化训练使得模型在推理时仅需将控制信号设为期望的对齐级别即可生成高质量描述。深入分析显示了我们的框架在处理噪声方面的有效性。通过零样本描述和利用生成描述进行文本到图像检索(即自检索)两项任务,我们还证明了我们的模型能在描述性和区分性方面生成高质量描述。代码见 \url{https://github.com/kakaobrain/noc}。

关键词

引用

@article{arxiv.2212.13563,
  title  = {Noise-aware Learning from Web-crawled Image-Text Data for Image Captioning},
  author = {Wooyoung Kang and Jonghwan Mun and Sungjun Lee and Byungseok Roh},
  journal= {arXiv preprint arXiv:2212.13563},
  year   = {2023}
}