利用预训练自监督学习模型表征改进声学至发音逆映射
音频与语音处理
2022-11-01 v1 声音
摘要
在本工作中,我们研究预训练自监督学习 (SSL) 特征对于学习声学至发音逆映射 (AAI) 映射的有效性。基于信号处理的声学特征(如 MFCC)已主要被用于基于深度神经网络的 AAI 任务。随着 SSL 特征在各种其他语音任务(如语音识别、情感分类等)中表现良好,我们实验了其在 AAI 中的效能。我们在具有 3 种不同模型复杂度的基于 transformer 神经网络的 AAI 模型上以 SSL 特征进行训练,并在特定主体 (SS)、合并与微调 (FT) 配置下利用来自 10 名受试者的数据将其性能与 MFCC 比较,并在未见句子测试集上以相关系数 (CC) 分数评估。我们发现基于声学特征重建目标的 SSL 特征(如 TERA 和 DeCoAR)对 AAI 效果良好,这些 SSL 特征的 SS CC 接近 MFCC 的最佳 FT CC。我们还发现结果在不同模型规模下具有一致性。
引用
@article{arxiv.2210.16871,
title = {Improved acoustic-to-articulatory inversion using representations from pretrained self-supervised learning models},
author = {Sathvik Udupa and Siddarth C and Prasanta Kumar Ghosh},
journal= {arXiv preprint arXiv:2210.16871},
year = {2022}
}
备注
submitted to ICASSP 2023