video-SALMONN:语音增强的音视频大语言模型
计算机视觉与模式识别
2024-06-25 v1
摘要
语音理解作为更通用视频理解中音视频大语言模型(audio-visual large language models, av-LLMs)的元素,是一个关键但鲜有人研究的方面。本文提出了 video-SALMONN,一个用于视频处理的单一端到端 av-LLM,能够理解视觉帧序列、音频事件和音乐,亦能理解语音。为获得语音理解所需的细粒度时序信息,同时保持对其他视频元素的高效性,本文提出了一种新的多分辨率因果 Q-Former(MRC Q-Former)结构,用于连接预训练的音视频编码器和主干大语言模型。此外,还提出了专门的训练方法,包括多样性损失和非配对音视频混合训练方案,以避免帧或模态的主导。在引入的语音-音视频评估基准测试上,video-SALMONN 在视频-QA 任务上实现了超过 25% 的绝对准确率提升,在音视频 QA 任务上实现了超过 30% 的绝对准确率提升。此外,video-SALMONN 在其他 av-LLMs 尚未实现的任务上表现出卓越的视频理解和推理能力。我们的训练代码和模型检查点可在 \texttt{\url{https://github.com/bytedance/SALMONN/}} 上获取。
引用
@article{arxiv.2406.15704,
title = {video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models},
author = {Guangzhi Sun and Wenyi Yu and Changli Tang and Xianzhao Chen and Tian Tan and Wei Li and Lu Lu and Zejun Ma and Yuxuan Wang and Chao Zhang},
journal= {arXiv preprint arXiv:2406.15704},
year = {2024}
}
备注
Accepted at ICML 2024. arXiv admin note: substantial text overlap with arXiv:2310.05863