超越图像描述的图像文本生成进展:以自合理化为例的研究
计算与语言
2022-10-25 v2 计算机视觉与模式识别
摘要
将视觉模态与预训练语言模型结合,对于图像描述等简单描述性任务出奇地有效。然而更通用的文本生成仍难以实现。我们退一步追问:这些模型对于更复杂的生成任务(即同时以文本和图像为条件)表现如何?多模态模型仅仅是视觉适配的语言模型,还是联合跨模态进行推理?我们在三个任务的自合理化(联合生成任务标签/答案与自由文本解释)背景下研究这些问题:(i) VQA-X 中的视觉问答,(ii) VCR 中的视觉常识推理,以及 (iii) e-SNLI-VE 中的视觉-文本蕴含。我们表明,近期的单模态进展、CLIP 图像表示以及语言模型规模化,并不能一致地改善多模态任务中的自合理化。我们发现,没有单一模型类型能在所有任务、数据集和微调数据规模上普遍最优。我们的发现促使人们需要新颖的通用骨干方法,以将图像与文本的文生生成从图像描述推向更远处。
引用
@article{arxiv.2205.11686,
title = {On Advances in Text Generation from Images Beyond Captioning: A Case Study in Self-Rationalization},
author = {Shruti Palaskar and Akshita Bhagia and Yonatan Bisk and Florian Metze and Alan W Black and Ana Marasović},
journal= {arXiv preprint arXiv:2205.11686},
year = {2022}
}
备注
v2: EMNLP Findings 2022 accepted paper camera-ready version. 9 pages main, 2 pages appendix