改进声道特征重构的泛化能力:从增强的声学反演到无发声器官数据的发音特征重构
计算与语言
2023-09-13 v2
摘要
我们研究在给定音频和/或音素标签的情况下重构发音运动的问题。多说话人发声器官数据的稀缺性使得学习能够泛化到新说话人及跨数据集的重构十分困难。我们首先考虑 XRMB 数据集,其中音频、发音测量值与音素转写均可用。我们表明,在匹配与不匹配的训练-测试条件下,用作深度循环神经网络输入的音素标签,在重构发音特征时通常比声学特征更有帮助。在第二个实验中,我们测试了一种新方法,试图从音素标签提取的先验发音信息构建发音特征。该方法无需使用任何发音测量值,即可直接从纯声学数据集中恢复声道运动。结果表明,该方法生成的发音特征与实测发音特征的 Pearson 积矩相关系数最高可达 0.59。
引用
@article{arxiv.1809.00938,
title = {Improving generalization of vocal tract feature reconstruction: from augmented acoustic inversion to articulatory feature reconstruction without articulatory data},
author = {Rosanna Turrisi and Raffaele Tavarone and Leonardo Badino},
journal= {arXiv preprint arXiv:1809.00938},
year = {2023}
}
备注
IEEE Workshop on Spoken Language Technology (SLT)