OmniFusion:通过模块化融合实现多语言多模态同步翻译
计算与语言
2026-04-02 v2 人工智能
摘要
开源文本-only 翻译大语言模型(LLM)在语言覆盖范围和质量方面取得了显著进展。然而,这些模型只能用于语音翻译(ST)中的级联管道,需先进行自动语音识别,再进行翻译。这会引入额外的延迟,尤其在同步语音翻译(SimulST)中尤为关键,也阻止了模型利用多模态上下文(如图像)进行消歧。预训练的多模态基础模型(MMFM)已具备跨多模态的强大感知与推理能力,但通常缺乏专用翻译 LLM 的多语言覆盖和专业翻译性能。为构建有效的多模态翻译系统,我们提出了一种端到端的方法,通过模块化融合将 MMFM 与翻译 LLM 融合。我们引入一种新颖的融合策略,将预训练 MMFM 多层隐藏状态连接到翻译 LLM 上,实现联合端到端训练。构建的模型 OmniFusion 基于 Omni 2.5-7B 作为 MMFM,SeedX PPO-7B 作为翻译 LLM,能够执行语音到文本、语音与图像到文本、以及文本与图像到文本翻译。实验表明,OmniFusion 有效利用音频和视觉输入,在 SimulST 中相较于级联管道实现 1 秒延迟降低,同时提升整体翻译质量\footnote{代码可在 https://github.com/saikoneru/OmniFusion 查阅。}
引用
@article{arxiv.2512.00234,
title = {OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion},
author = {Sai Koneru and Matthias Huck and Jan Niehues},
journal= {arXiv preprint arXiv:2512.00234},
year = {2026}
}
备注
Revised submission in review for ACL ARR