现代视频-LLM 是否需要倾听?基准审计与可扩展解决方案
计算机视觉与模式识别
2026-03-25 v3 多媒体
声音
摘要
多年来社区努力开发的语音和音频编码器常被排除在视频理解管道之外——并非因为它们不起作用,而是因为基准测试从未要求进行听觉处理。我们审计了 10 个视频基准测试,发现许多问题仅凭视觉线索即可解决:单帧探测器即可在无音频情况下解答约 76% 的 AVQA,表明对音频-视觉推理的测量效果不佳。基于 LLaVA-OneVision,我们附加了语音/音频编码器,并在 25 倍 token 降低(25 Hz 降至 1 Hz)下比较了五种压缩架构。在 10 个基准测试中——无论是否过滤——音频在需要语音理解或跨模态锚定的任务上均显著提升,而视觉中心的套件则基本不受影响。我们的结果表明,语音编码器在视频理解中的作用远大于当前基准测试所暗示的作用。我们将在 https://github.com/naver-ai/LLaVA-AV-SSM 上完全开源。
引用
@article{arxiv.2509.17901,
title = {Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy},
author = {Geewook Kim and Minjoon Seo},
journal= {arXiv preprint arXiv:2509.17901},
year = {2026}
}
备注
Submitted to Interspeech 2026