利用语音信号多分辨率谱时表示的声学至发音语音反演
音频与语音处理
2022-06-28 v2 人工智能
机器学习
声音
信号处理
摘要
语音信号的多分辨率谱时特征通过调节皮层细胞对不同谱和时间调制的响应,表征大脑感知声音的方式。这些特征产生了语音信号的更高维表示。本文旨在评估语音信号的听觉皮层表示在估计相应信号的发音特征方面的贡献程度。由于从语音信号的声学特征获取发音特征一直是不同语音领域令人关注且具有挑战性的课题,我们探究使用这种语音信号的多分辨率表示作为声学特征的可能性。我们使用威斯康星大学X射线微束(XRMB)干净语音信号数据库训练一个前馈深度神经网络(DNN)来估计六个声道变量的发音轨迹。通过选取适当的尺度与速率向量参数选择用于训练模型的最优多分辨率谱时特征集合,以获得性能最佳的模型。实验与真实声道变量的相关系数达到0.675。我们将该语音反演系统的性能与先前使用梅尔频率倒谱系数(MFCCs)进行的实验进行了比较。
引用
@article{arxiv.2203.05780,
title = {Acoustic To Articulatory Speech Inversion Using Multi-Resolution Spectro-Temporal Representations Of Speech Signals},
author = {Rahil Parikh and Nadee Seneviratne and Ganesh Sivaraman and Shihab Shamma and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2203.05780},
year = {2022}
}
备注
Accepted at ISCA Interspeech 2022