中文

面向实际场景的颌裂咬合功能失调相关鼻音表征学习的鲁棒性

音频与语音处理 2026-03-19 v1

摘要

颌裂功能失调(VPD)由于言语中颌窦闭合不足导致鼻音增大和语言可理解性下降。尽管基于语音的机器学习模型在标准化临床录音条件下表现良好,但由于设备、信道、噪声和房间声学的差异,实际场景下的模型性能常会下降。为提高鲁棒性,我们提出了两个阶段的框架用于VPD筛查。首先,在带有音素对齐的辅助语料库上,以口语境与鼻音语境为监督,学习鼻音聚焦的语音表征。其次,冻结编码器并在0.5秒的语音块上使用轻量级分类器,其概率被聚合以产生基于固定阈值的录音级别决策。在82名受试者的临床队列中,该方法实现了完美的录音级别筛查性能(宏平均F1=1.000,准确率=1.000)。在另一套131名来自异构公共互联网录音的独立测试集上,大型预训练语音表征显著退化,而MFCC是最强的基线模型(宏平均F1=0.612,准确率=0.641)。所提出的方法在相同评估协议下取得最佳的测试集表现(宏平均F1=0.679,准确率=0.695),在最强基线之上实现了显著提升。这一结果表明,在临床分类前学习鼻音聚焦的表征可减少对录音制造 Artifact的敏感性,并提高面向部署的基于语音的VPD筛查鲁棒性。

关键词

引用

@article{arxiv.2603.17383,
  title  = {Robust Nasality Representation Learning for Cleft Palate-Related Velopharyngeal Dysfunction Screening in Real-World Settings},
  author = {Weixin Liu and Bowen Qu and Amy Stone and Maria E. Powell and Shama Dufresne and Stephane Braun and Izabela Galdyn and Michael Golinko and Bradley Malin and Zhijun Yin and Matthew E. Pontell},
  journal= {arXiv preprint arXiv:2603.17383},
  year   = {2026}
}

备注

2 figures. Machine learning for speech-based VPD screening under domain shift