训练发音逆映射模型以实现说话人一致性
声音
2025-06-10 v3 机器学习
音频与语音处理
摘要
声学-发音逆映射 (AAI) 试图对从语音到发音的逆映射进行建模。仅从语音精确预测发音可能是不可能的,因为说话者似乎可以在不参考其声道结构的情况下选择不同的发音形式。然而,一旦说话者选定了一种发音形式,他们的产出变化就很小。近期 AAI 的研究提出将自监督学习 (SSL) 模型适配到单说话人数据集,声称这些单说话人模型提供了一个通用的发音模板。在本文中,我们研究了在单说话人和多说话人数据上训练的 SSL 适配模型是否为英语和俄语生成了跨说话人身份一致的发音目标。我们通过使用一种新颖的评估方法来实现这一点,该方法利用最小对比对集提取发音目标。我们还提出了一种仅使用语音数据即可提高说话人一致性的训练方法。
引用
@article{arxiv.2505.20529,
title = {Training Articulatory Inversion Models for Interspeaker Consistency},
author = {Charles McGhee and Mark J. F. Gales and Kate M. Knill},
journal= {arXiv preprint arXiv:2505.20529},
year = {2025}
}