超声舌成像的视听自动同步
音频与语音处理
2021-06-01 v1 计算与语言
机器学习
声音
图像与视频处理
摘要
超声舌成像用于在言语产生过程中可视化口内发音器官。它应用于一系列场景,包括言语语言治疗与语音学研究。超声与语音音频被同步录制,为正确使用该数据,两种模态应被正确同步。同步在录制时通过专用硬件实现,但该方法在实践中可能失效,导致数据可用性受限。本文解决数据采集后自动同步超声与音频的问题。我们首先调查专家超声用户对同步误差的容忍度,以寻找误差检测的阈值。我们利用这些阈值定义评估系统准确性的评分边界。随后描述我们的自动同步方法,该方法由自监督神经网络驱动,利用两信号间的相关性进行同步。我们的模型在来自多领域、具有不同说话人特征、不同设备与不同录制环境的数据上训练,并在保留的同领域数据上达到 >92.4% 的准确率。最后,我们引入一个新资源——Cleft 数据集,该集由一新临床亚组采集且硬件同步不可靠。我们将模型应用于该跨领域数据,并由专家用户主观评估其性能。结果显示用户在我们模型输出优于原始硬件输出的情况下占 79.3%。我们的结果证明了方法的优势及其泛化至新领域数据的能力。
引用
@article{arxiv.2105.15162,
title = {Automatic audiovisual synchronisation for ultrasound tongue imaging},
author = {Aciel Eshky and Joanne Cleland and Manuel Sam Ribeiro and Eleanor Sugden and Korin Richmond and Steve Renals},
journal= {arXiv preprint arXiv:2105.15162},
year = {2021}
}
备注
18 pages, 10 figures. Manuscript accepted at Speech Communication