通过离散标记增强的儿童语音识别
计算与语言
2024-06-25 v2 声音
音频与语音处理
摘要
儿童语音识别被视为一个数据稀缺的任务,主要原因是缺乏公开可用的数据。这种数据稀缺的原因包括高昂的数据收集和标注成本,以及数据隐私问题等。将语音信号转化为不携带敏感信息但能够捕捉语言和声学信息的离散标记,可能是解决数据隐私问题的一种方案。本研究探究了将离散语音标记整合到儿童语音识别系统中作为输入,而不会显著降低语音识别性能的可能性。此外,我们还探索了创建这些离散标签的单视图和多视图策略。进一步,我们测试了模型在未见域和非母语数据集上的泛化能力。结果表明,针对儿童的离散标记语音识别几乎能够实现与原方法相当的性能,而参数数量减少了约83%。
引用
@article{arxiv.2406.13431,
title = {Children's Speech Recognition through Discrete Token Enhancement},
author = {Vrunda N. Sukhadia and Shammur Absar Chowdhury},
journal= {arXiv preprint arXiv:2406.13431},
year = {2024}
}
备注
Accepted at Interspeech 2024