面向包容性语音识别:探索非英语语言困性说话人语音转换
计算与语言
2025-09-29 v5 声音
音频与语音处理
摘要
非英语语言困性说话人语音识别仍具有挑战性,尤其是数据稀缺的领域。为此,我们在英语困性说话人语音 (UASpeech) 上对语音转换模型进行微调,以编码说话人特征和语音失真,然后将其应用于将健康非英语语音 (FLEURS) 转换为非英语困性说话人风格语音。生成的数据随后用于微调多语言语音识别模型(Massively Multilingual Speech,MMS),以提高困性说话人语音识别性能。在 PC-GITA(西班牙语)、EasyCall(意大利语)和 SSNCE(泰米尔语)上的评估表明,进行说话人特征和语音失真转换的语音转换显著优于即插即用的 MMS 性能和常规数据增强技术(如语速和节奏扰动)。对生成数据的客观与主观分析进一步确认,生成语音模拟了困性说话人的特征。
引用
@article{arxiv.2505.14874,
title = {Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages},
author = {Chin-Jou Li and Eunjung Yeo and Kwanghee Choi and Paula Andrea Pérez-Toro and Masao Someki and Rohan Kumar Das and Zhengjun Yue and Juan Rafael Orozco-Arroyave and Elmar Nöth and David R. Mortensen},
journal= {arXiv preprint arXiv:2505.14874},
year = {2025}
}
备注
5 pages, 1 figure, Proceedings of Interspeech