寻找我的声音:面向自动化临床评估的障碍语音生成式重建
声音
2025-09-24 v1 人工智能
计算与语言
摘要
我们提出了 ChiReSSD,一种在抑制发音错误的同时保留儿童说话人身份的语音重建框架。与以往在健康成人语音上训练的方法不同,ChiReSSD 适应于患有语音障碍儿童的语音,特别关注音高和韵律。我们在 STAR 数据集上评估了该方法,并在词汇准确率和说话人身份保留方面报告了显著改善。此外,我们自动预测原始和重建语音对中的语音内容,其中辅音纠正的比例与辅音正确率百分比这一临床语音评估指标相当。我们的实验显示,自动标注与人类专家标注之间的 Pearson 相关系数为 0.63,突显了减轻人工转录负担的潜力。此外,在 TORGO 数据集上的实验证明了对重建成人构音障碍语音的有效泛化。我们的结果表明,解耦的、基于风格的 TTS 重建能够为多样化的临床人群提供保留身份的语音。
引用
@article{arxiv.2509.19231,
title = {Finding My Voice: Generative Reconstruction of Disordered Speech for Automated Clinical Evaluation},
author = {Karen Rosero and Eunjung Yeo and David R. Mortensen and Cortney Van't Slot and Rami R. Hallac and Carlos Busso},
journal= {arXiv preprint arXiv:2509.19231},
year = {2025}
}