基于语音和文本信息的多模态无言说话检测与严重程度评估方法
人工智能
2025-04-29 v4 音频与语音处理
摘要
无言说话的自动检测和严重程度评估对于为患者提供针对性治疗干预至关重要。虽然大多数现有研究主要关注语音模态,但本研究引入了一种新方法,利用语音和文本两种模态。通过采用跨注意力机制,我们的方法学习语音和文本表示之间的声学和语言相似性。该方法评估特定严重程度水平下不同发音偏差,从而提高了无言说话检测和严重程度评估的准确性。所有实验都使用UA-Speech无言说话数据库进行。在说话者依赖和说话者独立、未见词和已见词设置下,分别实现了99.53%和93.20%的检测准确率,以及98.12%和51.97%的严重程度评估准确率。这些发现表明,通过整合提供参考语言知识的文本信息,已开发出更稳健的无言说话检测和评估框架,从而可能导致更有效的诊断。
引用
@article{arxiv.2412.16874,
title = {A Multi-modal Approach to Dysarthria Detection and Severity Assessment Using Speech and Text Information},
author = {Anuprabha M and Krishna Gurugubelli and V Kesavaraj and Anil Kumar Vuppala},
journal= {arXiv preprint arXiv:2412.16874},
year = {2025}
}
备注
Submitted to ICASSP 2025