面向语音障碍自动评估的预训练语音模型解释
声音
2024-07-02 v1 人工智能
音频与语音处理
摘要
语音包含与某些疾病相关的临床信息,这些信息有望用于健康评估。近期工作显示,对深度学习算法,尤其是预训练的大型语音模型用于自动语音评估具有潜在应用价值。一个尚未探索的问题是,这些模型是如何基于其输入输出结果的。在本文中,我们训练并比较两种 Audio Spectrogram Transformer 配置,用于语音障碍检测,并应用注意力滚动方法产生模型相关性图,这些图计算了模型作出预测时对语谱图区域的相关性。我们使用这些图来分析模型在不同条件下的预测方式,并表明随着模型微调,注意力范围会减少,模型注意力集中在特定音素区域。
引用
@article{arxiv.2407.00531,
title = {Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders},
author = {Hok-Shing Lau and Mark Huntly and Nathon Morgan and Adesua Iyenoma and Biao Zeng and Tim Bashford},
journal= {arXiv preprint arXiv:2407.00531},
year = {2024}
}