AURA:面向音视频推理的细粒度基准与分解式度量
计算机视觉与模式识别
2025-08-22 v2
摘要
当前的音视频基准测试侧重于最终答案的准确性,忽略了底层的推理过程。这使得难以区分真正的理解与通过有缺陷的推理或幻觉得出的正确答案。为解决此问题,我们引入了 AURA(音视频理解与推理评估),一个用于评估音视频大语言模型和全模态语言模型跨模态推理能力的基准。AURA 包含跨越六个具有挑战性的认知领域的问题,例如因果关系、音色与音高、节奏与音视频同步、不可回答性、隐式干扰和技能剖析,这些问题被明确设计为无法从单一模态回答。这迫使模型构建一个同时基于音频和视频的有效逻辑路径,使 AURA 区别于那些允许单模态捷径的 AV 数据集。为了评估推理轨迹,我们提出了一种新的度量标准 AuraScore,以解决缺乏评估推理保真度的鲁棒工具的问题。它将推理分解为两个方面:(i) 事实一致性——推理是否基于感知证据,以及 (ii) 核心推理——每个推理步骤的逻辑有效性。在 AURA 上对 SOTA 模型的评估揭示了一个关键的推理差距:尽管模型在某些任务上达到了高准确率(高达 92%),但它们的事实一致性和核心推理得分低于 45%。这种差异凸显了模型经常通过有缺陷的逻辑得出正确答案,强调了我们的基准的必要性,并为更鲁棒的多模态评估铺平了道路。
引用
@article{arxiv.2508.07470,
title = {AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning},
author = {Siminfar Samakoush Galougah and Rishie Raj and Sanjoy Chowdhury and Sayan Nag and Ramani Duraiswami},
journal= {arXiv preprint arXiv:2508.07470},
year = {2025}
}