阅读、观看还是聆听?解决多模态数据集需要什么
计算机视觉与模式识别
2023-07-11 v1 人工智能
计算与语言
音频与语音处理
摘要
大规模多模态数据集的普及给数据集质量评估带来了独特挑战。我们提出一种两步法来分析多模态数据集,该方法利用少量人工标注种子,将每个多模态实例映射到处理它所需的模态。我们的方法揭示了数据集中不同模态的重要性及其相互关系。我们将该方法应用于视频问答数据集 TVQA,发现大多数问题可使用单一模态回答,且不存在对任何特定模态的显著偏向。此外,我们发现超过 70% 的问题可通过多种不同的单模态策略解决,例如仅观看视频或仅聆听音频,这突显了 TVQA 中多模态融合的有限性。我们利用标注分析了 MERLOT Reserve,发现其在基于图像的问题上相较于文本和音频表现不佳,且在听觉说话人识别上也存在困难。基于我们的观察,我们引入了一个需要多模态的新测试集,观察到模型性能急剧下降。我们的方法为多模态数据集提供了有价值的见解,并强调了开发更鲁棒模型的必要性。
引用
@article{arxiv.2307.04532,
title = {Read, Look or Listen? What's Needed for Solving a Multimodal Dataset},
author = {Netta Madvil and Yonatan Bitton and Roy Schwartz},
journal= {arXiv preprint arXiv:2307.04532},
year = {2023}
}