中文

多选视觉问答及更广领域中的数据集偏差缓解

计算机视觉与模式识别 2023-11-02 v2 人工智能 计算与语言 机器学习 多媒体

摘要

视觉-语言(VL)理解任务通过多选题评估模型对复杂视觉场景的理解。然而,我们识别出两种数据集偏差,模型可将其作为捷径来正确解决各类 VL 任务而无需恰当理解。第一类数据集偏差为强调不匹配(Unbalanced Matching)偏差,其中正确答案比错误答案与问题和图像重叠更多。第二类数据集偏差为干扰项相似度(Distractor Similarity)偏差,其中错误答案与正确答案过度不相似,但在同一样本内与其他错误答案显著相似。为解决这些数据集偏差,我们首先提出对抗数据合成(ADS)来生成合成训练与去偏评估数据。随后我们引入样本内反事实训练(ICT),通过聚焦样本内区分来辅助模型利用合成训练数据,尤其是反事实数据。大量实验证明了 ADS 与 ICT 在不同基准上一致提升模型性能的有效性,即便在域偏移场景下亦然。

关键词

引用

@article{arxiv.2310.14670,
  title  = {Dataset Bias Mitigation in Multiple-Choice Visual Question Answering and Beyond},
  author = {Zhecan Wang and Long Chen and Haoxuan You and Keyang Xu and Yicheng He and Wenhao Li and Noel Codella and Kai-Wei Chang and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2310.14670},
  year   = {2023}
}

备注

EMNLP 2023