SGEITL:用于视觉常识推理的场景图增强图像-文本学习
计算机视觉与模式识别
2021-12-17 v1 人工智能
计算与语言
机器学习
多媒体
摘要
回答关于图像的复杂问题是机器智能的一个雄心目标,这需要对图像、文本和常识知识的联合理解,以及强大的推理能力。近来,多模态Transformer通过在若干层跨模态注意力中联合理解视觉对象与文本词元,在视觉常识推理(VCR)任务上取得了很大进展。然而,这些方法未利用场景的丰富结构以及对象间的交互,而后者对回答复杂常识问题至关重要。我们提出一种场景图增强图像-文本学习(SGEITL)框架,将视觉场景图纳入常识推理。为利用场景图结构,在模型结构层面,我们提出一种多跳图Transformer以正则化各跳之间的注意力交互。在预训练方面,提出一种场景图感知的预训练方法,以利用从视觉场景图中提取的结构知识。此外,我们引入一种以弱监督方式利用文本标注训练并生成领域相关视觉场景图的方法。在VCR及其他任务上的大量实验表明,与最先进(state-of-the-art)方法相比性能显著提升,并证明了各提出组件的有效性。
引用
@article{arxiv.2112.08587,
title = {SGEITL: Scene Graph Enhanced Image-Text Learning for Visual Commonsense Reasoning},
author = {Zhecan Wang and Haoxuan You and Liunian Harold Li and Alireza Zareian and Suji Park and Yiqing Liang and Kai-Wei Chang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2112.08587},
year = {2021}
}
备注
AAAI 2022