看、听、答:克服音频-视觉问答中的偏见
计算机视觉与模式识别
2025-03-06 v4
摘要
音频-视觉问答(AVQA)是一项复杂的多模态推理任务,要求智能系统基于音频-视频输入对准确回答自然语言查询。然而,流行的AVQA方法容易过度学习数据集偏见,导致鲁棒性差。此外,当前数据集可能无法为这些方法提供精确的诊断。为应对这些挑战,首先,我们提出一个新数据集MUSIC-AVQA-R,通过两步构建:改写公共数据集(MUSIC-AVQA)测试集中的问题,然后引入分布偏移来划分问题。前者产生大而多样的测试空间,后者则实现对罕见、频繁和总体问题的全面鲁棒性评估。其次,我们提出一个鲁棒架构,利用多面循环协作去偏策略来克服偏见学习。实验结果表明,该架构在MUSIC-AVQA-R上达到最先进性能,显著提升9.32%。在两个数据集上进行了大量消融实验,分析去偏策略中各组件的有效性。此外,通过在我们的数据集上评估,我们突显了现有多模态问答方法的有限鲁棒性。我们还结合各种基线与我们提出的策略在两个数据集上进行实验,验证其即插即用能力。我们的数据集和代码可在https://github.com/reml-group/MUSIC-AVQA-R获取。
引用
@article{arxiv.2404.12020,
title = {Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering},
author = {Jie Ma and Min Hu and Pinghui Wang and Wangchun Sun and Lingyun Song and Hongbin Pei and Jun Liu and Youtian Du},
journal= {arXiv preprint arXiv:2404.12020},
year = {2025}
}
备注
Accepted by NeurIPS 2024