基于超声的 Silent Speech 接口的神经网络说话人嵌入
声音
2021-06-14 v2
摘要
发音到声学映射旨在从发音运动的记录(例如超声视频)中重建语音。正如语音信号一样,这些记录不仅表征语言内容,还高度依赖于实际说话人。因此,由于缺乏多说话人数据集,研究者迄今集中于说话人相关建模。在此,我们利用近期发布的 TaL80 语料库给出多说话人实验。为建模说话人特征,我们调整了语音处理中流行的 x-vector 框架以用于超声舌部视频。接着,我们使用语料库中 50 名说话人进行了说话人识别实验。然后,我们创建说话人嵌入向量并在其余说话人上评估它们。最后,我们考察了在多说话人场景下嵌入向量如何影响我们超声到语音转换网络的精度。实验中说话人识别错误率低于 3%,并且我们发现嵌入向量能很好地泛化至未见说话人。我们将其应用于多说话人 silent speech 框架的首次尝试使谱估计步骤的错误率略有降低。
引用
@article{arxiv.2106.04552,
title = {Neural Speaker Embeddings for Ultrasound-based Silent Speech Interfaces},
author = {Amin Honarmandi Shandiz and László Tóth and Gábor Gosztolya and Alexandra Markó and Tamás Gábor Csapó},
journal= {arXiv preprint arXiv:2106.04552},
year = {2021}
}
备注
5 pages, 3 figures, 3 tables