迈向音素与语音表示的匹配
计算与语言
2023-10-27 v1 机器学习
声音
音频与语音处理
摘要
从音素实例中学习音素类型是一个长期存在且仍未解决的问题。在这项工作中,我们在自监督学习的背景下重新审视该问题,并将其表述为将聚类中心与音素嵌入相匹配的问题。我们研究了实现匹配的两个关键性质,即自监督表示的聚类中心是否降低了音素实例的变异性并尊重音素之间的关系。然后我们利用匹配结果生成伪标签,并引入一种新的损失函数以改进自监督表示。我们的实验表明,匹配结果捕捉了音素之间的关系。将新损失函数与常规自监督损失(如 APC 和 CPC)联合训练,显著改善了下游音素分类。
引用
@article{arxiv.2310.17558,
title = {Towards Matching Phones and Speech Representations},
author = {Gene-Ping Yang and Hao Tang},
journal= {arXiv preprint arXiv:2310.17558},
year = {2023}
}
备注
Accepted to ASRU 2023