基于前提的多模态推理:联合文本与视觉线索的条件推断
计算与语言
2022-03-18 v3
摘要
近期视觉语言跨模态推理的工作普遍采用二分类或多选分类形式,以一组源图像和文本查询作为输入。本文对这样一种无条件的建模方式进行了冷静审视,即未针对源图像指定任何先验知识。受视觉常识推理与自然语言推理任务设计的启发,我们提出一项新任务,称为基于前提的多模态推理(Premise-based Multi-modal Reasoning, PMR),其中文本前提是对每张源图像的背景预设。PMR数据集包含15,360个手动标注样本,通过多阶段众包流程创建。借助精选的高质量电影截图以及来自6个预定义类别的人工整理前提模板,我们要求众包工作者在前提和图像的基础上,通过交叉核对流程写出一个真实假设与三个干扰项(4个选项)。此外,我们生成对抗样本以缓解标注伪影,并将PMR规模扩大一倍。我们在PMR上对多种最先进(预训练)多模态推理模型进行基准测试,并开展全面的实验分析以展示该数据集的效用。
引用
@article{arxiv.2105.07122,
title = {Premise-based Multimodal Reasoning: Conditional Inference on Joint Textual and Visual Clues},
author = {Qingxiu Dong and Ziwei Qin and Heming Xia and Tian Feng and Shoujie Tong and Haoran Meng and Lin Xu and Weidong Zhan and Sujian Li and Zhongyu Wei and Tianyu Liu and Zuifang Sui},
journal= {arXiv preprint arXiv:2105.07122},
year = {2022}
}
备注
ACL 2022 Main conference (Long Paper)