R-AVST:面向复杂音视频场景的细粒度时空推理能力提升
计算机视觉与模式识别
2025-12-01 v2
摘要
最近,多模态大语言模型(MLLM)在视频理解任务上取得了快速进展。然而,当前研究聚焦于简单视频场景,未能体现现实世界音视频事件在视频中的复杂多样性。为弥合这一差距,我们首次引入R-AVST数据集,用于音视频推理,包含细粒度时空标注。在构建该数据集时,我们设计了包括基于大语言模型的对象提取、自动空间标注和人工质量审核的 pipeline,构建了超过5000段未裁剪视频,覆盖27000个对象,涵盖100种音视频事件类型。基于该数据集,我们定义了音视频场景下的三类时空推理任务,并生成了超过8000个高质量、分布均匀的问答对,以有效衡量模型性能。为进一步提升推理能力,我们提出了AVST-Zero模型,基于强化学习,无需中间监督,直接通过精心设计的多维奖励进行行为优化。大量实验验证了R-AVST在推动音视频时空推理方面的有效性,AVST-Zero在已有模型基础上展现出竞争性能。迄今为止,R-AVST是首个面向现实世界音视频时空推理的数据集,AVST-Zero为该领域的未来挑战提供了新的视角。
引用
@article{arxiv.2511.16901,
title = {R-AVST: Empowering Video-LLMs with Fine-Grained Spatio-Temporal Reasoning in Complex Audio-Visual Scenarios},
author = {Lu Zhu and Tiantian Geng and Yangye Chen and Teng Wang and Ping Lu and Feng Zheng},
journal= {arXiv preprint arXiv:2511.16901},
year = {2025}
}
备注
Accepted by AAAI 2026. Project page: https://github.com/zhlllau/R-AVST