基于原始超声的儿童语音音段说话人无关分类
音频与语音处理
2019-07-03 v1 计算与语言
计算机视觉与模式识别
机器学习
声音
图像与视频处理
摘要
超声舌成像(UTI)提供了一种在语音产生过程中可视化声道的便捷方式。UTI正日益用于言语治疗,使得开发自动方法以辅助言语治疗师当前执行的各类耗时手工任务变得重要。一个关键挑战是将超声舌图像的自动处理推广到先前未见的说话人。本工作中,我们在若干训练场景下研究从原始超声记录中对音段(舌形)进行分类:说话人相关、多说话人、说话人无关与说话人自适应。我们观察到当模型应用于训练时未见的说话人数据时会表现不佳。然而,当提供极少的额外说话人信息(如平均超声帧)时,模型对未见说话人的泛化更好。
引用
@article{arxiv.1907.01413,
title = {Speaker-independent classification of phonetic segments from raw ultrasound in child speech},
author = {Manuel Sam Ribeiro and Aciel Eshky and Korin Richmond and Steve Renals},
journal= {arXiv preprint arXiv:1907.01413},
year = {2019}
}
备注
5 pages, 4 figures, published in ICASSP2019 (IEEE International Conference on Acoustics, Speech and Signal Processing, 2019)