中文

Whisper-UT:面向语音与文本的统一翻译框架

计算与语言 2025-09-23 v1

摘要

编码器-解码器模型在语音和文本任务中取得了显著成功,但如何高效地将这些模型适应于多样的单/多模态场景仍是一个开放挑战。在本文中,我们提出了 Whisper-UT,一个统一且高效的框架,利用轻量级适配器实现跨任务的无缝适应,包括一个多模态机器翻译(MMT)任务,该任务以语音和源语言文本输入两者为翻译的显式条件。通过将 ASR 假设或真实转录作为提示,该方法不仅使系统能够同时处理两种模态,还通过两阶段解码策略增强了语音翻译(ST)性能。我们使用 Whisper 模型展示了我们的方法,尽管原则上它们是通用的,可以应用于类似的多任务模型。我们强调了跨模态和跨任务微调的有效性,它在不需要三方平行数据的情况下提升了性能。我们的结果突显了所提出框架在多模态翻译中的灵活性、高效性和广泛适用性。

关键词

引用

@article{arxiv.2509.16375,
  title  = {Whisper-UT: A Unified Translation Framework for Speech and Text},
  author = {Cihan Xiao and Matthew Wiesner and Debashish Chakraborty and Reno Kriz and Keith Cunningham and Kenton Murray and Kevin Duh and Luis Tavarez-Arce and Paul McNamee and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2509.16375},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference