中文

对失语者语音重建的对比学习增强

音频与语音处理 2024-10-08 v1

摘要

失语者语音重建因其病理性声模式而具有挑战性。尤其是在没有正常语音的情况下,保持说话人身份识别是关键挑战之一。我们提出的方法采用对比学习提取说话人嵌入进行语音重建,同时使用 XLS-R 表示代替滤波器组。结果表明,语音质量、自然度、可理解性、说话人身份识别以及对女性说话人的性别一致性均得到改善。对于使用 Jasper 语音识别系统的中度和中度-重度失语者,重建语音的平均值得分(MOS)提高了 1.51 和 2.12 分,词错误率分别降低了 25.45% 和 32.1%。该方法为失语者语音重建带来了具有前景的进展。

关键词

引用

@article{arxiv.2410.04092,
  title  = {Enhancement of Dysarthric Speech Reconstruction by Contrastive Learning},
  author = {Keshvari Fatemeh and Mahdian Toroghi Rahil and Zareian Hassan},
  journal= {arXiv preprint arXiv:2410.04092},
  year   = {2024}
}