中文

通过文本生成统一视觉与语言任务

计算与语言 2021-05-25 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

现有的视觉与语言学习方法通常要求为每个任务设计特定的架构和目标。例如,用于视觉问答的多标签答案分类器、用于指代表达理解的候选区域打分器,以及用于图像字幕的语言解码器等。为减轻这些繁琐工作,本文提出一个统一框架,以单一架构和相同的语言建模目标(即多模态条件文本生成)学习不同任务,其中我们的模型学习基于视觉和文本输入以文本形式生成标签。在 7 个流行的视觉与语言基准上,包括视觉问答、指代表达理解、视觉常识推理(其中大多数先前被建模为判别任务),我们的生成式方法(采用单一统一架构)达到了与近期特定任务最先进(SOTA)视觉与语言模型相当的性能。此外,我们的生成式方法在对具有罕见答案的问题上展现出更好的泛化能力。我们还表明,我们的框架允许在单一架构中以单组参数进行多任务学习,取得与单独优化的单任务模型相似的性能。我们的代码公开于:https://github.com/j-min/VL-T5

关键词

引用

@article{arxiv.2102.02779,
  title  = {Unifying Vision-and-Language Tasks via Text Generation},
  author = {Jaemin Cho and Jie Lei and Hao Tan and Mohit Bansal},
  journal= {arXiv preprint arXiv:2102.02779},
  year   = {2021}
}

备注

ICML 2021 (15 pages, 4 figures, 14 tables)