中文

POTSA:面向语音到文本翻译的跨语言语音对齐框架

计算与语言 2026-04-01 v3 声音

摘要

语音大语言模型在多语言语音到文本翻译方面取得了突破,但现有方法常常忽视源语言之间的语义共性,导致翻译性能偏差。本文提出 POTSA(Parallel Optimal Transport for Speech Alignment,语音对齐的平行最优传输),一个基于跨语言平行语音对和最优传输设计的新框架,用于弥合高资源和低资源翻译之间的差距。首先,我们引入偏差补偿模块,以粗略方式对初始语音表示进行对齐。随后,我们在 Q-Former 上施加基于平行对的 token 级 OT 约束,以建立细粒度的表示一致性。然后,我们应用一种层级调度策略,将 OT 约束聚焦于在语义上有益的层。在 FLEURS 数据集上的实验表明,我们的方法实现了 SOTA 性能,仅使用每语言 10 小时的平行语音,即可在五种通用语言上获得 +1.29 BLEU,在零样本语言上获得 +2.93 BLEU。

关键词

引用

@article{arxiv.2511.09232,
  title  = {POTSA: A Cross-Lingual Speech Alignment Framework for Speech-to-Text Translation},
  author = {Xuanchen Li and Chenrui Cui and Tianrui Wang and Meng Ge and Zikang Huang and Yizhou Peng and Jin Li and Yuheng Lu and Yu Jiang and Nyima Tashi and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2511.09232},
  year   = {2026}
}