端到端语音模型学到了哪些说话人、语言与信道信息?一项逐层与神经元级分析
计算与语言
2023-07-12 v3 声音
音频与语音处理
摘要
深度神经网络本质上不透明且难以解释。与基于手工特征构建的模型不同,我们难以理解所学概念及其在模型内的交互方式。这种理解不仅对调试至关重要,也对伦理决策中的公平性保障十分关键。在本研究中,我们利用探测框架 [1] 对预训练语音模型进行事后功能性可解释性分析。具体而言,我们分析了为说话人识别、方言识别等多种任务训练的语音模型的语句级表征。我们进行逐层与神经元级分析,探测说话人、语言与信道属性。本研究旨在回答以下问题:i) 表征中捕获了什么信息?ii) 信息如何表示与分布?iii) 我们能否识别出拥有该信息的最小网络子集?我们的结果揭示了若干新发现,包括:i) 信道与性别信息分布于整个网络,ii) 就某一任务而言信息在神经元中冗余可用,iii) 方言信息等复杂属性仅编码于面向任务的预训练网络中,iv) 且定位于上层,v) 我们可提取编码预定义属性的最小神经元子集,vi) 显著神经元有时在属性间共享,vii) 我们的分析凸显了网络中偏置(例如性别)的存在。跨架构比较表明:i) 预训练模型捕获说话人不变信息,ii) CNN 模型在编码多种未被充分研究的属性上与 Transformer 模型具有竞争力。
引用
@article{arxiv.2107.00439,
title = {What do End-to-End Speech Models Learn about Speaker, Language and Channel Information? A Layer-wise and Neuron-level Analysis},
author = {Shammur Absar Chowdhury and Nadir Durrani and Ahmed Ali},
journal= {arXiv preprint arXiv:2107.00439},
year = {2023}
}
备注
Accepted in CSL journal. Keywords: Speech, Neuron Analysis, Interpretibility, Diagnostic Classifier, AI explainability, End-to-End Architecture