识别自监督语音Transformer前馈层中的说话人信息
计算与语言
2025-06-30 v1 声音
音频与语音处理
摘要
近年来,自监督语音Transformer的影响已扩展到与说话人相关的应用。然而,很少有研究探索这些模型如何编码说话人信息。在这项工作中,我们通过识别前馈层中与说话人信息相关的神经元来填补这一空白。具体来说,我们分析了与自监督特征的k-means聚类和i-向量相关的神经元。我们的分析表明,这些聚类对应于广泛的语音类别和性别类别,使其适用于识别代表说话人的神经元。通过在剪枝过程中保护这些神经元,我们可以显著保持与说话人相关任务的性能,证明了它们在编码说话人信息中的关键作用。
引用
@article{arxiv.2506.21712,
title = {Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers},
author = {Tzu-Quan Lin and Hsi-Chun Cheng and Hung-yi Lee and Hao Tang},
journal= {arXiv preprint arXiv:2506.21712},
year = {2025}
}