掩码自编码器是发音学习器
音频与语音处理
2023-05-19 v3 机器学习
声音
摘要
发音记录追踪声道中不同发音器官的位置和运动,被广泛用于研究言语产生以及开发基于发音的语音合成器和语音反转系统等语音技术。威斯康星大学X射线微束数据集是提供与音频录音同步的发音记录的数据集之一。该数据集的发音记录使用放置在多个发音器官上的小球,由微束进行追踪。然而,相当一部分发音记录存在追踪错误,迄今无法使用。本工作中,我们提出一种基于深度学习的方法,使用掩码自编码器准确重建该数据集中47位说话人中41位的错误追踪发音记录。即使在八个发音器官中有三个追踪错误的情况下,我们的模型也能重建出与真实值高度吻合的发音轨迹,并恢复了此前无法使用的3.4小时录音中的3.28小时。
引用
@article{arxiv.2210.15195,
title = {Masked Autoencoders Are Articulatory Learners},
author = {Ahmed Adel Attia and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2210.15195},
year = {2023}
}