探究自动语音识别系统中基于神经网络的声学模型所编码的信息
声音
2024-03-01 v1 人工智能
音频与语音处理
摘要
深度学习架构在许多研究领域的性能方面取得了显著进展。自动语音识别(ASR)领域因此受益于这些科技进步,特别是在声学建模方面,现已集成了深度神经网络架构。然而,这些性能的提升也导致了通过这些黑盒架构学习和传递的信息复杂性增加。继许多关于神经网络可解释性的研究之后,本文提出了一种协议,旨在确定 ASR 声学模型(AM)中信息的位置及类型。为此,我们建议使用中间表示(此处为不同层级)在一系列既定任务上评估 AM 的性能。关于性能变化和目标任务,我们可以假设在架构的不同步骤中哪些信息被增强或扰动。实验在说话人验证、声学环境分类、性别分类、 tempo 失真检测系统以及语音情感/情绪识别系统上进行。分析表明,基于神经网络的 AM 持有异构信息,这些信息似乎与音素识别惊人地不相关,例如情绪、情感或说话人身份。低层隐藏层总体上似乎对信息的结构化有用,而高层则倾向于删除对音素识别无用的信息。
引用
@article{arxiv.2402.19443,
title = {Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems},
author = {Quentin Raymondaud and Mickael Rouvier and Richard Dufour},
journal= {arXiv preprint arXiv:2402.19443},
year = {2024}
}