中文

利用单元语言指导提升无文本语音到语音翻译中的语音建模

计算与语言 2025-05-22 v1 人工智能 声音 音频与语音处理

摘要

构建无文本语音到语音翻译 (S2ST) 模型的成功吸引了广泛关注。然而,S2ST 仍面临两个主要挑战:1) 提取各种语音信号的语言特征,称为跨模态 (cross-modal, CM);2) 在长序列中学习不同语言的对齐,称为跨语言 (cross-lingual, CL)。我们提出了单元语言来克服这两个建模挑战。单元语言可以考虑一种类似文本的表示格式,通过 nn-gram 语言模型构建。我们实现了多任务学习,以在指导语音建模过程中利用单元语言。我们的初始结果揭示了在同时应用源单元语言和目标单元语言时会出现冲突。我们提出了任务提示建模来缓解这一冲突。在 Voxpupil 数据集上进行了四种语言的实验。我们的方法在强基准模型上显著改进性能,并达到了与使用文本训练的模型相当的性能。

关键词

引用

@article{arxiv.2505.15333,
  title  = {Leveraging Unit Language Guidance to Advance Speech Modeling in Textless Speech-to-Speech Translation},
  author = {Yuhao Zhang and Xiangnan Ma and Kaiqi Kou and Peizhuo Liu and Weiqiao Shan and Benyou Wang and Tong Xiao and Yuxin Huang and Zhengtao Yu and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2505.15333},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings