中文

从扁平语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件建模

计算与语言 2026-05-18 v1 人工智能

摘要

基于语音大语言模型的组合式语音到语音翻译系统近来展现出令人鼓舞的性能。然而,现有的 S2ST 系统常常忽略源语言信息,或通过“语言即标签”的范式对其进行编码,将每种源语言表示为一个独立的扁平嵌入。这种设计忽略了跨语言共享的系统性语言结构,这可能在有监督 S2ST 数据稀缺时限制数据高效的多语言适应。为解决此问题,我们提出 S2ST-Omni 2,这是一个多对一的组合式 S2ST 框架,系统地将多语言条件建模从扁平语言标签重构为结构化的类型学先验。具体而言,S2ST-Omni 2 在三个层面重新审视了语言条件建模:用于结构化源语言表示的类型学信息层次化语言编码,用于内容自适应声学调制的动态门控语言感知 Dual-CTC,以及用于解码器端语言引导的类型学感知 LLM 提示。在 CVSS-C 上的实验表明,在所采用的评估协议下,S2ST-Omni 2 在 BLEU、COMET、ASR-BLEU 和 BLASER 2.0 指标上,在代表性 S2ST 方法中取得了优越的平均性能。消融研究表明,所提出的表示级、声学级和解码级策略提供了互补的益处。此外,受控的数据预算分析以及仅使用约 3 小时监督训练数据的日语到英语评估表明,显式的类型学先验为数据高效的多语言 S2ST 提供了有用的归纳偏置。

关键词

引用

@article{arxiv.2605.16026,
  title  = {From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation},
  author = {Yu Pan and Yang Hou and Xiongfei Wu and Liang Zhang and Yves Le Traon and Lei Ma and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2605.16026},
  year   = {2026}
}

备注

Submitted to IEEE/ACM TASLP. This work extends S2ST-Omni, accepted to Findings of ACL 2026