基于实时MRI声道形状动力学的无声语音与情感识别
图像与视频处理
2021-06-17 v1 计算机视觉与模式识别
人机交互
机器学习
声音
音频与语音处理
摘要
口语的语音通过变化声道周围发音器官的配置而获得。它们包含丰富信息,可用于更好地理解人类语音产生的潜在机制。我们提出一种新颖的基于深度神经网络的学习框架,其理解语音产生过程中由实时磁共振成像(rtMRI)捕获的变长声道塑形序列中的声学信息,并将其翻译为文本。所提框架由时空卷积、一个循环网络以及连接主义时序分类损失组成,完全端到端训练。在USC-TIMIT语料库上,该模型在句子级别取得了40.6%的PER,远优于现有模型。据我们所知,这是首个基于rtMRI视频捕获的个体发音运动来识别完整口语句子的研究。我们还分析了声道各子区域(即咽、软腭与舌背、硬腭、唇缩区)的发音几何形状相对于不同情感与性别的变化。结果表明,每个子区域的形变都受到情感与性别的共同影响。
引用
@article{arxiv.2106.08706,
title = {Silent Speech and Emotion Recognition from Vocal Tract Shape Dynamics in Real-Time MRI},
author = {Laxmi Pandey and Ahmed Sabbir Arif},
journal= {arXiv preprint arXiv:2106.08706},
year = {2021}
}
备注
8 pages