中文

多模态大语言模型中视频表征的实证研究

信息检索 2025-10-15 v1

摘要

多模态大语言模型最近在视频问答 (VideoQA) 中取得了显著进展,通过联合处理视觉、文本和音频信息。然而,究竟哪些视频表征对 MLLMs 最为有效,以及不同模态如何在任务准确性与计算效率之间进行权衡,仍不为人知。本 work 提供了一项关于 MLLMs 视频问答中视频表征方法的全面实证研究。我们系统评估了单模态输入(仅问题、字幕、视觉帧、音频信号)以及多模态组合,在两个广泛使用的基准数据集上进行测试:VideoMME 和 LongVideoBench。我们的结果表明,视觉帧显著提升准确率,但会在 GPU 内存和推理延迟方面带来巨大开销,而字幕则提供了轻量且有效的替代方案,尤其适用于长视频。这些发现凸显了有效性与效率之间的明确权衡,并为设计面向资源的 MLLM 视频问答系统提供了实用见解。

关键词

引用

@article{arxiv.2510.12299,
  title  = {An Empirical Study for Representations of Videos in Video Question Answering via MLLMs},
  author = {Zhi Li and Yanan Wang and Hao Niu and Julio Vizcarra and Masato Taya},
  journal= {arXiv preprint arXiv:2510.12299},
  year   = {2025}
}

备注

6 pages, 3 figures