音素如何贡献于深度说话人模型?
声音
2024-02-08 v1 音频与语音处理
摘要
哪些音素传递更多的说话人特征是一个长期存在的问题,已有各种针对人类受试者的感知实验。对于说话人识别,使用传统统计模型进行了研究,得出的结论与感知结果大致一致。然而,由于决策过程的不透明性,现代深度神经模型中哪些音素更为重要仍未被探索。本文从模型解释的角度,对基于TDNN和CNN的两种深度说话人模型进行了音素归因的新研究。具体而言,我们通过两种事后解释方法——LayerCAM和时间对齐遮挡(TAO)——进行了研究。实验结果表明:(1)在群体层面上,元音比辅音更重要,证实了人类感知研究。然而,摩擦音是最不重要的音素之一,这与以往研究形成对比。(2)在说话人层面上,观察到音素重要性存在较大的说话人间差异,表明一个音素是否重要在很大程度上取决于说话人。
引用
@article{arxiv.2402.02730,
title = {How phonemes contribute to deep speaker models?},
author = {Pengqi Li and Tianhao Wang and Lantian Li and Askar Hamdulla and Dong Wang},
journal= {arXiv preprint arXiv:2402.02730},
year = {2024}
}