语音学引导的非洲语言语音到语音翻译
音频与语音处理
2025-06-12 v3 人工智能
计算与语言
摘要
我们提出了一种韵律引导的语音到语音翻译(S2ST)框架,通过利用跨语言停顿同步性来对齐和翻译语音,无需转录文本。分析一个涵盖五种语言的6,000小时东非新闻语料库,我们表明同语系语言对的停顿方差比跨语系语言对低30–40%,起始/结束相关性高3倍以上。这些发现催生了\textbf{SPaDA},一种整合停顿一致性、速率同步性和语义相似性的动态规划对齐算法。SPaDA将对齐提升了3–4个百分点,相比贪婪VAD基线消除了高达38%的虚假匹配。利用SPaDA对齐的片段,我们训练了\textbf{SegUniDiff},一种由冻结语义和说话人编码器的\textit{外部梯度}引导的基于扩散的S2ST模型。SegUniDiff在BLEU上匹配增强级联模型(CVSS-C上30.3对比UnitY的28.9),将说话人错误率(EER)从12.5%降至5.3%,且以1.02的RTF运行。为支持低资源环境下的评估,我们还发布了一个三层、无转录的BLEU测试套件(M1–M3),与人类判断高度相关。总体而言,我们的结果表明,多语言语音中的韵律线索为可扩展的非自回归S2ST提供了可靠的支架。
引用
@article{arxiv.2410.23323,
title = {Phonology-Guided Speech-to-Speech Translation for African Languages},
author = {Peter Ochieng and Dennis Kaburu},
journal= {arXiv preprint arXiv:2410.23323},
year = {2025}
}