CDSD:中文构音障碍语音数据库
声音
2025-02-14 v2 音频与语音处理
摘要
构音障碍语音给构音障碍患者带来显著挑战,影响其社会交流能力。尽管自动语音识别(ASR)已被广泛使用,但准确识别构音障碍语音仍是一项艰巨任务,主要归因于构音障碍语音数据的有限可用量。为弥补这一缺口,我们构建了中文构音障碍语音数据库(CDSD),这是迄今为止规模最大的中文构音障碍数据集合,包含来自 44 名说话人的 133 小时录音。我们的基准测试显示最佳字符错误率(CER)为 16.4%。与我们额外人类实验所得的 20.45% CER 相比,构音障碍语音识别(DSR)展现出其在显著改善构音障碍患者交流方面的潜力。CDSD 数据库将于 http://melab.psych.ac.cn/CDSD.html 公开提供。
引用
@article{arxiv.2310.15930,
title = {CDSD: Chinese Dysarthria Speech Database},
author = {Yan Wang and Mengyi Sun and Xinchen Kang and Jingting Li and Pengfei Guo and Ming Gao and Su-Jing Wang},
journal= {arXiv preprint arXiv:2310.15930},
year = {2025}
}
备注
Accepted at INTERSPEECH 2024 Yan Wang and Mengyi Sun contributed equally to this research