在VQA中使用多级对比学习实现更忠实的自然语言解释
计算与语言
2023-12-22 v1 人工智能
计算机视觉与模式识别
摘要
视觉问答中的自然语言解释(VQA-NLE)旨在通过生成自然语言句子来解释模型的决策过程,以增加用户对黑盒系统的信任。现有的事后方法在获得合理解释方面取得了显著进展。然而,这类事后解释并不总是与人类的逻辑推理一致,存在以下问题:1)演绎不可满足性,生成的解释在逻辑上无法推导出答案;2)事实不一致,模型在生成反事实解释时未考虑图像中的事实;3)语义扰动不敏感性,模型无法识别微小扰动引起的语义变化。这些问题降低了模型生成解释的忠实性。为解决上述问题,我们提出了一种新颖的自监督多级对比学习自然语言解释模型(MCLE),用于VQA,该模型利用语义级、图像级和实例级的事实与反事实样本。MCLE提取判别性特征,并将解释的特征空间与视觉问答对齐,以生成更一致的解释。我们在两个VQA-NLE基准上进行了大量实验、消融分析和案例研究,证明了我们方法的有效性。
引用
@article{arxiv.2312.13594,
title = {Towards More Faithful Natural Language Explanation Using Multi-Level Contrastive Learning in VQA},
author = {Chengen Lai and Shengli Song and Shiqi Meng and Jingyang Li and Sitong Yan and Guangneng Hu},
journal= {arXiv preprint arXiv:2312.13594},
year = {2023}
}
备注
AAAI 2024