中文

我们能信任ASR上的可解释AI方法吗?基于音素识别的评估

计算与语言 2023-05-30 v1 声音 音频与语音处理

摘要

可解释AI(XAI)技术已被广泛用于帮助解释和理解图像分类和自然语言处理等领域中深度学习模型的输出。利用XAI技术解释基于深度学习的自动语音识别(ASR)的兴趣正在兴起,但关于这些解释是否可信尚缺乏足够证据。为此,我们将图像分类领域中最先进的XAI技术局部可解释模型无关解释(LIME)适配到为基于TIMIT的音素识别任务训练的模型上。这一简单任务提供了受控的评估环境,同时也提供了专家标注的 ground truth 以评估解释质量。我们发现,基于时间划分音频段的LIME变体(本文提出)产生了最可靠的解释,在其前三个音频段中包含 ground truth 的概率达96%。

关键词

引用

@article{arxiv.2305.18011,
  title  = {Can We Trust Explainable AI Methods on ASR? An Evaluation on Phoneme Recognition},
  author = {Xiaoliang Wu and Peter Bell and Ajitha Rajan},
  journal= {arXiv preprint arXiv:2305.18011},
  year   = {2023}
}