通过自监督嵌入与增强声道变量改进语音反演
音频与语音处理
2024-09-10 v2 人工智能
声音
摘要
深度学习模型的性能在很大程度上取决于其高效编码输入特征并解码为有意义输出的能力。更好的输入与输出表示有望提升模型性能与泛化能力。在声学至发音语音反演(SI)系统背景下,我们研究了利用通过自监督学习(SSL)模型(如HuBERT)获取的语音表示相较于传统声学特征的影响。此外,我们探究通过改进的几何变换模型引入新型声道变量(TVs)。结合这两种方法,我们将评估SI系统TV估计准确度的皮尔逊积矩相关系数(PPMC)得分从0.7452提升至0.8141,增幅6.9%。我们的发现凸显了来自SSL模型的丰富特征表示与带目标TVs的改进几何变换对增强SI系统功能的深远影响。
引用
@article{arxiv.2309.09220,
title = {Improving Speech Inversion Through Self-Supervised Embeddings and Enhanced Tract Variables},
author = {Ahmed Adel Attia and Yashish M. Siriwardena and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2309.09220},
year = {2024}
}