中文

AUDITA:审计人类与 AI 在音频 QA 能力的新数据集

计算与语言 2026-04-24 v1

摘要

现有的音频问答基准测试主要侧重于声音事件分类或基于字幕的查询,常常通过捷径策略、短时段线索、词汇先验、数据集特定偏差,甚至通过元数据和字幕绕过音频而非进行真正的推理来实现模型成功。因此,我们提出了 AUDITA(Audio Understanding from Diverse Internet Trivia Authors),这是一个大规模、真实世界的基准测试,用于严格评估超越表层声学识别的音频推理能力。AUDITA 包含经过精心挑选的人类编写的、基于真实音频的 trivia 题目,旨在通过包含挑战性干扰项和长程时序依赖性,以及无法仅凭孤立文本或声音线索就回答的探针查询来考验稳健的听觉推理。人类平均准确率为 32.13%,显示了任务的难度,同时表明具有意义的音频理解。与此相反,最先进的音频问答模型表现poor,平均准确率低于 8.86%。除了原始准确率,我们应用项目反应理论(IRT)来估计潜在技能、问题难度,并揭示模型和数据存在的系统性缺陷。

关键词

引用

@article{arxiv.2604.21766,
  title  = {AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA},
  author = {Tasnim Kabir and Dmytro Kurdydyk and Aadi Palnitkar and Liam Dorn and Ahmed Haj Ahmed and Jordan Lee Boyd-Graber},
  journal= {arXiv preprint arXiv:2604.21766},
  year   = {2026}
}