中文

DAVE:音频-视觉评估的诊断基准

计算机视觉与模式识别 2025-12-05 v2 人工智能 机器学习

摘要

音频-视觉理解是一个快速发展的领域,旨在整合和解释来自听觉和视觉两种模态的信息。尽管多模态学习近期取得了进展,但现有基准往往存在强烈的视觉偏差——当答案仅从视觉数据中即可推断时——并且仅提供聚合分数,将多种误差来源混为一谈。这使得很难确定模型是在视觉理解、音频解释还是音频-视觉对齐方面存在困难。在这项工作中,我们引入了DAVE:诊断性音频-视觉评估(Diagnostic Audio Visual Evaluation),一个旨在系统评估音频-视觉模型的新型基准数据集。DAVE通过(i)确保正确回答需要两种模态以及(ii)将评估解耦为原子子类别来缓解现有限制。我们对最先进模型的详细分析揭示了特定的失败模式并提供了有针对性的改进见解。通过提供这种标准化的诊断框架,我们旨在促进音频-视觉模型的更稳健开发。数据集:https://huggingface.co/datasets/gorjanradevski/dave 代码:https://github.com/gorjanradevski/dave

关键词

引用

@article{arxiv.2503.09321,
  title  = {DAVE: Diagnostic benchmark for Audio Visual Evaluation},
  author = {Gorjan Radevski and Teodora Popordanoska and Matthew B. Blaschko and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2503.09321},
  year   = {2025}
}

备注

First two authors contributed equally