中文

Speech Vecalign:基于嵌入的并行语音文档对齐方法

计算与语言 2025-09-24 v1

摘要

我们提出了Speech Vecalign,一种基于嵌入的并行语音文档对齐方法,它单调地对齐语音段嵌入且不依赖文本转录。与基线方法Global Mining(一种语音挖掘变体)相比,Speech Vecalign产生了更长的语音到语音对齐。它也比Local Mining(另一种语音挖掘变体)表现出更强的鲁棒性,因为它产生的噪声更少。我们将Speech Vecalign应用于来自VoxPopuli的3000小时无标签并行英德(En-De)语音文档,获得了约1000小时的高质量对齐。然后我们在对齐数据上训练了英德语音到语音翻译模型。Speech Vecalign在En-to-De和De-to-En性能上分别比Global Mining提升了0.37和0.18 ASR-BLEU。此外,我们的模型在仅使用1/8原始语音文档的情况下,匹配或超越了SpeechMatrix模型的性能。

关键词

引用

@article{arxiv.2509.18360,
  title  = {Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documents},
  author = {Chutong Meng and Philipp Koehn},
  journal= {arXiv preprint arXiv:2509.18360},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 (main)