应对 MUSIC-AVQA 中的数据偏差:构建用于无偏问答的平衡数据集
计算机视觉与模式识别
2023-10-11 v1 人工智能
计算与语言
机器学习
多媒体
声音
音频与语音处理
摘要
近年来,音频、视觉与文本模态交叉融合的研究日益受到重视,推动了多模态研究的发展。然而,任一模态中存在的强偏差都可能导致模型忽略其他模态,从而削弱模型跨多种模态进行有效推理的能力,阻碍进一步进展。本文细致审视原始数据集中的每一类问题,筛选出答案偏差显著的问题类型。为抵消这些偏差,我们收集了互补的视频与问题,确保没有任何答案呈现突出的偏斜分布。特别地,对于二值问题,我们力求在每个问题类别内使两种答案几乎均匀分布。由此,我们构建了一个名为 MUSIC-AVQA v2.0 的新数据集,它更具挑战性,且我们相信能更好地促进 AVQA 任务的进步。此外,我们提出了一种新颖的基线模型,更深入地探究音频-视觉-文本间的相互关系。在 MUSIC-AVQA v2.0 上,该模型超越了所有现有基准,准确率提升 2%,确立了新的 SOTA 性能。
引用
@article{arxiv.2310.06238,
title = {Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering},
author = {Xiulong Liu and Zhikang Dong and Peng Zhang},
journal= {arXiv preprint arXiv:2310.06238},
year = {2023}
}