面向带自然语言解释的视觉蕴涵的块感知对齐与词汇约束方法
计算与语言
2022-12-05 v2 计算机视觉与模式识别
多媒体
摘要
带自然语言解释的视觉蕴涵旨在推断文本-图像对之间的关系并生成句子解释决策过程。先前方法主要依赖预训练视觉-语言模型进行关系推断,并依赖语言模型生成相应解释。然而,预训练视觉-语言模型主要建立文本与图像间的词元级对齐,忽略了短语(块)与视觉内容间对视觉-语言推理至关重要的高层语义对齐。此外,仅基于编码联合表示的解释生成器未显式考虑关系推断的关键决策点,因而生成的解释对视觉-语言推理的忠实度较低。为缓解这些问题,我们提出一种统一的基于块感知对齐与词汇约束的方法,称为 CALeC。它包含块感知语义交互器(简称 CSI)、关系推断器和词汇约束感知生成器(简称 LeCG)。具体而言,CSI 利用语言固有的句子结构和多种图像区域建立块感知语义对齐。关系推断器使用基于注意力的推理网络融合词元级与块级视觉-语言表示。LeCG 利用词汇约束将关系推断器关注的词或块显式纳入解释生成,提升解释的忠实度与信息量。我们在三个数据集上进行了充分实验,结果表明 CALeC 在推断准确率和生成解释质量上显著优于其他对比模型。
引用
@article{arxiv.2207.11401,
title = {Chunk-aware Alignment and Lexical Constraint for Visual Entailment with Natural Language Explanations},
author = {Qian Yang and Yunxin Li and Baotian Hu and Lin Ma and Yuxing Ding and Min Zhang},
journal= {arXiv preprint arXiv:2207.11401},
year = {2022}
}
备注
11 pages (including Supplementary Materials); Accepted to ACM MM 2022