中文

AV-Reasoner:改进和基准化线索导向音视频计数任务

计算机视觉与模式识别 2025-07-23 v2

摘要

尽管在视频理解方面取得了进展,当前的大语言模型多模态模型(MLLMs)在计数任务方面仍面临挑战。现有的基准测试受限于短视频、封闭式查询、缺乏线索标注以及多模态覆盖不足。在本文中,我们引入了 CG-AV-Counting,这是一个包含 1,027 个多模态问题和 5,845 项标注线索的手动标注线索导向计数基准测试,覆盖 497 个长视频。它支持黑盒和白盒评估,为端到端和基于推理的计数提供了全面的测试平台。为探索改进模型计数能力的方法,我们提出了 AV-Reasoner,这是一个在相关任务上进行课程学习并使用 GRPO 训练以泛化计数能力的模型。AV-Reasoner 在多个基准测试上实现了最先进的结果,表明了强化学习的有效性。然而,实验表明,在超出域的基准测试中,仅在语言空间进行推理并不带来性能提升。我们的代码和基准测试已发布于 https://av-reasoner.github.io。

关键词

引用

@article{arxiv.2506.05328,
  title  = {AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs},
  author = {Lidong Lu and Guo Chen and Zhiqi Li and Yicheng Liu and Tong Lu},
  journal= {arXiv preprint arXiv:2506.05328},
  year   = {2025}
}

备注

21 pages, 11 figures