桥接感知-统计鸿沟:为何机器学习在颤语评估中仍不够
音频与语音处理
2025-10-28 v1 机器学习
摘要
从语音中自动化检测和评估颤语的工作因其潜在的临床影响而引起了广泛关注。尽管声学建模和深度学习取得了快速进展,但模型仍不足以达到人类专家水平。本文提供了全面分析,强调我们称之为“感知-统计鸿沟”的概念性分歧。我们详细阐述了人类专家的感知过程,调查了机器学习表示和方法,综述了现有文献中特征集和建模策略,提出了标签噪声和评审者间变异性所施加的理论限制。我们进一步概述了缩小鸿沟的实用策略,包括感知动机特征、自监督预训练、ASR 信息目标、多模态融合、人类在回路内训练和可解释性方法。最后,我们提出了与临床目标相匹配的实验协议和评估指标,以指导未来研究,致力于开发可靠且可解释的颤语评估工具。
引用
@article{arxiv.2510.22237,
title = {Bridging the Perceptual-Statistical Gap in Dysarthria Assessment: Why Machine Learning Still Falls Short},
author = {Krishna Gurugubelli},
journal= {arXiv preprint arXiv:2510.22237},
year = {2025}
}