中文

基于DNN利用超声舌成像的声学至发音逆映射

声音 2019-04-16 v1 音频与语音处理 组织与器官

摘要

语音声音由发音器官的协调运动产生。有若干可用方法对发音运动与所得语音信号之间的关系建模。其逆问题常被称为声学至发音逆映射(AAI)。本文中我们实现了几种不同的深度神经网络(DNNs)来从声学信号估计发音信息。已有若干相关先前工作执行该任务,但其中大多数使用电磁发音描记术(EMA)追踪发音运动。与 EMA 相比,若考虑设备成本、便携性、安全性和可视化结构,超声舌成像(UTI)是一种性价比更高的技术。鉴于此,我们的目标是在以语音为输入时训练一个 DNN 来获取 UT 图像。我们还测试了两种表示发音信息的方法:1)本征舌空间;2)原始超声图像。作为重建 UT 图像的客观质量度量,我们使用 MSE、结构相似性指数(SSIM)和复小波 SSIM(CW-SSIM)。我们的实验结果表明 CW-SSIM 是 UTI 背景下最有用的误差度量。我们测试了三种不同的系统配置:a)由 2 个隐藏层组成的简单 DNN,以 UTI 文件的 64x64 像素为目标;b)相同的简单 DNN,但以投影到本征舌空间的超声图像为目标;c)由 5 个隐藏层组成的更复杂 DNN,以投影到本征舌空间的 UTI 文件为目标。在主观实验中,受试者发现具有两个隐藏层的神经网络更适用于该逆映射任务。

关键词

引用

@article{arxiv.1904.06083,
  title  = {DNN-based Acoustic-to-Articulatory Inversion using Ultrasound Tongue Imaging},
  author = {Dagoberto Porras and Alexander Sepúlveda-Sepúlveda and Tamás Gábor Csapó},
  journal= {arXiv preprint arXiv:1904.06083},
  year   = {2019}
}

备注

8 pages, 5 figures, Accepted to IJCNN 2019