多模态大语言模型赋能视频翻译
计算机视觉与模式识别
2026-04-14 v1
摘要
近期视频翻译技术的发展进一步提升了跨语言视频内容的获取,多模态大语言模型(MLLMs)正在发挥越来越重要的支持作用。凭借强大的多模态理解、推理和生成能力,基于MLLMs的视频翻译系统正在克服传统级联管道的局限性,这些管道分别处理自动语音识别、机器翻译、文本转语音和唇部同步。这种MLLMs驱动的方法不仅实现了与竞争或优于传统方法的翻译质量,还在零样本设置和多说话者场景中表现出更强的鲁棒性,同时联合建模语义忠实性、时序性、说话人身份和情感一致性。然而,尽管MLLMs快速发展且已有大量关于通用视频语言理解的综述,针对MLLMs如何赋能视频翻译任务的聚焦且系统化的综述仍缺乏。为填补这一空白,我们提供了基于MLLMs的视频翻译综述概览,围绕三个角色分类:1) 语义推理者,描述MLLMs如何进行视频理解、时序推理和多模态融合;2) 表达表现者,分析LLM驱动和LLM增强的技术用于表达性、可控语音生成;3) 视觉合成者,检视不同类型的视频生成器用于高保真唇部同步和视觉对齐。最后,我们讨论了视频理解、时序建模和多模态对齐方面的开放挑战,勾勒出MLLMs驱动视频翻译的前景研究方向。
引用
@article{arxiv.2604.11283,
title = {Empowering Video Translation using Multimodal Large Language Models},
author = {Bingzheng QU and Kehai Chen and Xuefeng Bai and Min Zhang},
journal= {arXiv preprint arXiv:2604.11283},
year = {2026}
}