UDM系列在实际颤声语音应用中的部署:临床评估框架
声音
2025-09-19 v1 人工智能
音频与语音处理
摘要
颤声和不完整语音检测系统传统上存在准确性与临床可解释性之间的权衡。虽然端到端深度学习模型实现了高性能,但其黑箱特性限制了临床应用。本文考察了无约束不完整性建模(Unconstrained Dysfluency Modeling, UDM)系列——由伯克利开发的当前最新框架,该框架结合了模块化架构、显式音素对齐以及可解释输出,适用于实际临床部署。通过大量实验 involving 患者和认证言语语言病理师(SLP),我们展示UDM在保持临床可解释性得分(4.2/5.0)的同时实现了最新性能(F1: 0.89±0.04)。我们的部署研究显示87%的临床医生接受率和34%的诊断时间缩短。这些结果为UDM代表着走向临床环境中AI辅助言语治疗的可行路径提供了有力证据。
引用
@article{arxiv.2509.14304,
title = {Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework},
author = {Eric Zhang and Li Wei and Sarah Chen and Michael Wang},
journal= {arXiv preprint arXiv:2509.14304},
year = {2025}
}