中文

用于改进视觉对话的两条因果原理

计算机视觉与模式识别 2025-12-11 v3 计算与语言

摘要

本文阐明了我们——2019 视觉对话挑战赛冠军团队 MReaL-BDAI——所采用的用于视觉对话挑战赛 2019 的设计技巧:用于改进视觉对话 (VisDial) 的两条因果原理。所谓“改进”,是指它们能将几乎所有现有的 VisDial 模型提升到排行榜上的最先进性能。如此重大的改进仅源于我们对模型与数据背后因果关系的细致审视,发现社区在 VisDial 中忽视了两种因果关系。直观上,原理 1 建议:我们应移除对话历史到回答模型的直接输入,否则会引入有害的捷径偏置;原理 2 指出:对于历史、问题和回答存在一个未观测混杂因子,导致来自训练数据的伪相关。特别地,为消除原理 2 中提出的混杂因子,我们提出了几种因果干预算法,使训练从根本上不同于传统的似然估计。注意这两条原理与模型无关,故适用于任何 VisDial 模型。代码见 https://github.com/simpleshinobu/visdial-principles。

关键词

引用

@article{arxiv.1911.10496,
  title  = {Two Causal Principles for Improving Visual Dialog},
  author = {Jiaxin Qi and Yulei Niu and Jianqiang Huang and Hanwang Zhang},
  journal= {arXiv preprint arXiv:1911.10496},
  year   = {2025}
}

备注

Accepted by CVPR 2020