TraceAV-Bench:面向长音视频轨迹的多跳轨迹推理基准
计算机视觉与模式识别
2026-05-11 v1
摘要
现实场景的音视频理解需要对稀疏、时序分散且跨模态的证据进行链式推理,而现有基准大多未能评估此能力。它们限制视频为短片段、孤立各模态或将问题简化为单跳感知。我们引入 TraceAV-Bench,这是第一个同时评估长音视频轨迹上多跳推理和多模态幻觉鲁棒性的基准。TraceAV-Bench 包含 2,200 个经过严格验证的多选题,覆盖 578 部长视频,总时长 339.5 小时,涵盖 4 个评估维度和 15 个子任务。每个问题基于显式推理链构建,平均跨越 3.68 次跳转,时序跨度达 15.1 分钟。数据集通过三阶段半自动化管道构建,随后经过严格的质量保证。评估多个代表性 OmniLLM 时发现,基准对所有模型都构成持久挑战,最强闭源模型(Gemini 3.1 Pro)仅在 general 任务上达到 68.29%,最佳开源模型(Ming-Flash-Omni-2.0)仅达到 51.70%,仍有显著提升空间。此外,我们发现多模态幻觉鲁棒性与一般多模态推理性能较难同步提升。我们预计 TraceAV-Bench 将激发进一步研究,以开发能够在长篇音视频内容中进行连贯可靠推理的 OmniLLM。
引用
@article{arxiv.2605.07593,
title = {TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos},
author = {Hengyi Feng and Hao Liang and Mingrui Chen and Bohan Zeng and Meiyi Qiang and Zhengyang Zhao and Zimo Meng and Zeang Sheng and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.07593},
year = {2026}
}