中文

应对 MUSIC-AVQA 中的数据偏差:构建用于无偏问答的平衡数据集

计算机视觉与模式识别 2023-10-11 v1 人工智能 计算与语言 机器学习 多媒体 声音 音频与语音处理

摘要

近年来,音频、视觉与文本模态交叉融合的研究日益受到重视,推动了多模态研究的发展。然而,任一模态中存在的强偏差都可能导致模型忽略其他模态,从而削弱模型跨多种模态进行有效推理的能力,阻碍进一步进展。本文细致审视原始数据集中的每一类问题,筛选出答案偏差显著的问题类型。为抵消这些偏差,我们收集了互补的视频与问题,确保没有任何答案呈现突出的偏斜分布。特别地,对于二值问题,我们力求在每个问题类别内使两种答案几乎均匀分布。由此,我们构建了一个名为 MUSIC-AVQA v2.0 的新数据集,它更具挑战性,且我们相信能更好地促进 AVQA 任务的进步。此外,我们提出了一种新颖的基线模型,更深入地探究音频-视觉-文本间的相互关系。在 MUSIC-AVQA v2.0 上,该模型超越了所有现有基准,准确率提升 2%,确立了新的 SOTA 性能。

关键词

引用

@article{arxiv.2310.06238,
  title  = {Tackling Data Bias in MUSIC-AVQA: Crafting a Balanced Dataset for Unbiased Question-Answering},
  author = {Xiulong Liu and Zhikang Dong and Peng Zhang},
  journal= {arXiv preprint arXiv:2310.06238},
  year   = {2023}
}