Speech Vecalign:基于嵌入的并行语音文档对齐方法
计算与语言
2025-09-24 v1
摘要
我们提出了Speech Vecalign,一种基于嵌入的并行语音文档对齐方法,它单调地对齐语音段嵌入且不依赖文本转录。与基线方法Global Mining(一种语音挖掘变体)相比,Speech Vecalign产生了更长的语音到语音对齐。它也比Local Mining(另一种语音挖掘变体)表现出更强的鲁棒性,因为它产生的噪声更少。我们将Speech Vecalign应用于来自VoxPopuli的3000小时无标签并行英德(En-De)语音文档,获得了约1000小时的高质量对齐。然后我们在对齐数据上训练了英德语音到语音翻译模型。Speech Vecalign在En-to-De和De-to-En性能上分别比Global Mining提升了0.37和0.18 ASR-BLEU。此外,我们的模型在仅使用1/8原始语音文档的情况下,匹配或超越了SpeechMatrix模型的性能。
引用
@article{arxiv.2509.18360,
title = {Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documents},
author = {Chutong Meng and Philipp Koehn},
journal= {arXiv preprint arXiv:2509.18360},
year = {2025}
}
备注
Accepted by EMNLP 2025 (main)