中文

探索基于ASR的Wav2Vec2用于自动语音障碍评估:洞见与分析

音频与语音处理 2024-10-14 v1 人工智能 计算与语言 声音

摘要

随着自监督学习(SSL)和自动语音识别(ASR)技术的兴起,基于ASR的Wav2Vec2模型已被微调用于自动语音障碍质量评估任务,取得令人印象深刻的效果,为头颈癌语境下的语音质量评估树立了新基准。这表明Wav2Vec2的ASR维度与评估维度密切相关。尽管该系统效果显著,但仍是黑箱模型,无法清晰解释模型ASR维度与临床评估之间的联系。本文首次对该基准模型进行语音质量评估分析,聚焦于可理解性和严重程度任务。我们进行了层级分析,以识别关键层并比较基于不同预训练数据的不同SSL和ASR Wav2Vec2模型。此外,采用后验XAI方法,包括规范相关性分析(CCA)和可视化技术,用于追踪模型演化并可视化嵌入,以增强可解释性。

关键词

引用

@article{arxiv.2410.08250,
  title  = {Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis},
  author = {Tuan Nguyen and Corinne Fredouille and Alain Ghio and Mathieu Balaguer and Virginie Woisard},
  journal= {arXiv preprint arXiv:2410.08250},
  year   = {2024}
}

备注

Accepted at the Spoken Language Technology (SLT) Conference 2024