LiveCC:基于流式语音转录的大规模视频 LLM 训练
摘要
最近的视频大型语言模型(Video LLM)常常依赖高昂的人工标注或专有模型 API(如 GPT-4o)来生成训练数据,这限制了其大规模训练。本文探索了使用廉价自动语音识别(ASR)转录文本进行 Video LLM 大规模训练。具体地,我们提出了一种新颖的流式训练方法,将 ASR 单词与视频帧根据时间戳进行密集交错。与之前基于 ASR 的视觉语言表示研究相比,我们的方法自然适配 ASR 的流式特性,从而使模型能够学习时间对齐的、细粒度的视觉语言建模。为支持该训练算法,我们引入了数据生产管道处理 YouTube 视频及其闭放式字幕(CC,即 ASR), resulting in Live-CC-5M 数据集用于预训练和 Live-WhisperX-526K 数据集用于高质量监督微调(SFT)。令人惊讶的是,即使没有 SFT,仅使用 ASR 预训练的 LiveCC-7B-Base 模型在一般视频问答性能方面也表现出竞争力,并展现出一种在实时视频评论中的新能力。为评估这一点,我们仔细设计了一个新的 LiveSports-3K 基准测试,使用 LLM 作为评判器来衡量自由形式的评论。实验表明,我们最终的 LiveCC-7B-Instruct 模型在评论质量方面能够超过先进的 72B 模型(如 Qwen2.5-VL-72B-Instruct、LLaVA-Video-72B),在实时模式下工作时也能做到这一点。同时,它在流行的视频问答基准测试(如 VideoMME 和 OVOBench)上取得了 7B/8B 规模的最先进结果,显示明确了该方法的广泛可迁移性。本论文的所有资源已发布于 https://showlab.github.io/livecc。
关键词
引用
@article{arxiv.2504.16030,
title = {LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale},
author = {Joya Chen and Ziyun Zeng and Yiqi Lin and Wei Li and Zejun Ma and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2504.16030},
year = {2025}
}
备注
CVPR 2025. If any references are missing, please contact [email protected]