多选视觉问答及更广领域中的数据集偏差缓解
计算机视觉与模式识别
2023-11-02 v2 人工智能
计算与语言
机器学习
多媒体
摘要
视觉-语言(VL)理解任务通过多选题评估模型对复杂视觉场景的理解。然而,我们识别出两种数据集偏差,模型可将其作为捷径来正确解决各类 VL 任务而无需恰当理解。第一类数据集偏差为强调不匹配(Unbalanced Matching)偏差,其中正确答案比错误答案与问题和图像重叠更多。第二类数据集偏差为干扰项相似度(Distractor Similarity)偏差,其中错误答案与正确答案过度不相似,但在同一样本内与其他错误答案显著相似。为解决这些数据集偏差,我们首先提出对抗数据合成(ADS)来生成合成训练与去偏评估数据。随后我们引入样本内反事实训练(ICT),通过聚焦样本内区分来辅助模型利用合成训练数据,尤其是反事实数据。大量实验证明了 ADS 与 ICT 在不同基准上一致提升模型性能的有效性,即便在域偏移场景下亦然。
引用
@article{arxiv.2310.14670,
title = {Dataset Bias Mitigation in Multiple-Choice Visual Question Answering and Beyond},
author = {Zhecan Wang and Long Chen and Haoxuan You and Keyang Xu and Yicheng He and Wenhao Li and Noel Codella and Kai-Wei Chang and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2310.14670},
year = {2023}
}
备注
EMNLP 2023