中文

基于空间 Transformer 网络适配超声舌成像静默语音接口

声音 2023-10-18 v3 机器学习 音频与语音处理

摘要

得益于最新的深度学习算法,静默语音接口(SSI)现已能够在一定条件下从发音运动数据合成可懂语音。然而,所得模型具有较强的说话人特异性,使得用户间快速切换十分麻烦。即使对同一说话人,这些模型在跨会话时表现不佳,即在拆卸并重新安装录制设备后。为了辅助基于超声舌成像的 SSI 模型进行快速的说话人与会话适配,我们用空间 Transformer 网络(STN)模块扩展了深度网络,该模块能够对输入图像执行仿射变换。尽管 STN 部分仅占网络约 10%,我们的实验表明,仅适配 STN 模块相比重训整个网络平均可将 MSE 降低 88%。当将该网络适配至同一说话人的不同录制会话时,改进甚至更大(约 92%)。

关键词

引用

@article{arxiv.2305.19130,
  title  = {Adaptation of Tongue Ultrasound-Based Silent Speech Interfaces Using Spatial Transformer Networks},
  author = {László Tóth and Amin Honarmandi Shandiz and Gábor Gosztolya and Csapó Tamás Gábor},
  journal= {arXiv preprint arXiv:2305.19130},
  year   = {2023}
}

备注

5 pages, 3 figures, 3 tables