基于音视频元音图注意力网络的肌肉痰疾自动评估
音频与语音处理
2024-05-08 v2
摘要
肌肉痰疾的自动评估始终是一个极具挑战性的任务,由于声信号的高变异性和数据有限的限制。当前,肌肉痰疾的自动评估研究主要集中在两种方法:一种是利用专家特征结合机器学习,另一种是采用数据驱动的深度学习方法来提取表示。研究表明,专家特征在代表病理特征方面有效,而深度学习方法在发现潜在特征方面表现出色。因此,整合专家特征和深度学习优势,以基于专家知识构建神经网络架构,可能对可解释性和评估性能都有益。就此而言,本文提出一种基于音视频信息的元音图注意力网络,有效地整合了专家知识和深度学习的优势。首先,综合了各种特征作为输入,包括基于知识的声学特征和深度学习基于预训练的表示。其次,设计了基于元音空间理论的图网络结构,以深入探索元音之间的空间相关性。最后,纳入视觉信息以进一步增强其鲁棒性和可泛化性。该方法在针对法棕分数进行回归实验中表现出优异于现有方法的性能。
引用
@article{arxiv.2405.03254,
title = {Automatic Assessment of Dysarthria Using Audio-visual Vowel Graph Attention Network},
author = {Xiaokang Liu and Xiaoxia Du and Juan Liu and Rongfeng Su and Manwa Lawrence Ng and Yumei Zhang and Yudong Yang and Shaofeng Zhao and Lan Wang and Nan Yan},
journal= {arXiv preprint arXiv:2405.03254},
year = {2024}
}
备注
10 pages, 7 figures, 7 tables