中文

通过词级音频段与副语言特征解释语音分类模型

计算与语言 2023-09-15 v1 声音 音频与语音处理

摘要

可解释人工智能(XAI)的最新进展为理解视觉、语言和表格数据模型如何运作提供了新见解。然而,用于理解语音模型的方法寥寥无几。现有工作聚焦于少数语音语言理解(SLU)任务,且解释对大多数用户而言难以解读。我们引入一种解释语音分类模型的新方法。我们通过两个信息层上的输入扰动生成易于解读的解释。1)词级解释揭示每个与词相关的音频段如何影响结果。2)副语言特征(如韵律和背景噪声)回答反事实问题:“如果我们以这种方式编辑音频信号,模型预测会是什么?”我们通过在英语和意大利语的两个语音分类任务上解释两个最先进的SLU模型来验证我们的方法。我们的发现表明,这些解释忠实于模型内部机制且对人类而言合理。我们的方法与发现为未来解释语音模型的研究铺平了道路。

关键词

引用

@article{arxiv.2309.07733,
  title  = {Explaining Speech Classification Models via Word-Level Audio Segments and Paralinguistic Features},
  author = {Eliana Pastor and Alkis Koudounas and Giuseppe Attanasio and Dirk Hovy and Elena Baralis},
  journal= {arXiv preprint arXiv:2309.07733},
  year   = {2023}
}

备注

8 pages