从音素序列与声学特征估计发音运动的比较研究
音频与语音处理
2020-02-20 v2 机器学习
摘要
与音素序列不同,言语发音器官(嘴唇、舌头、下颌、软腭)的运动及其产生的声学信号已知不仅编码语言信息,还携带副语言信息。虽然已有若干从声学信号估计发音运动的工作,但从仅有的语言信息(即音素序列)能在多大程度上预测发音运动则鲜为人知。在这项工作中,我们从三种不同的输入表示估计发音运动:R1)声学信号,R2)音素序列,R3)带时序信息的音素序列。对于R2使用注意力网络估计发音运动,而对于R1和R3使用BLSTM网络。对十名受试者的声学-发音数据的实验表明,估计技术在R1、R2和R3情况下分别达到0.85、0.81和0.81的平均相关系数。这表明注意力网络虽然仅使用无时序信息的音素序列(R2),却达到了与使用丰富声学信号(R1)相近的估计性能,说明发音运动主要由语言信息驱动。当联合使用R1和R3估计发音运动时,相关系数进一步提升至0.88。
引用
@article{arxiv.1910.14375,
title = {A comparative study of estimating articulatory movements from phoneme sequences and acoustic features},
author = {Abhayjeet Singh and Aravind Illa and Prasanta Kumar Ghosh},
journal= {arXiv preprint arXiv:1910.14375},
year = {2020}
}
备注
5 pages, 5 figures, accepted in ICASSP 2020