中文

识别自监督语音Transformer前馈层中的说话人信息

计算与语言 2025-06-30 v1 声音 音频与语音处理

摘要

近年来,自监督语音Transformer的影响已扩展到与说话人相关的应用。然而,很少有研究探索这些模型如何编码说话人信息。在这项工作中,我们通过识别前馈层中与说话人信息相关的神经元来填补这一空白。具体来说,我们分析了与自监督特征的k-means聚类和i-向量相关的神经元。我们的分析表明,这些聚类对应于广泛的语音类别和性别类别,使其适用于识别代表说话人的神经元。通过在剪枝过程中保护这些神经元,我们可以显著保持与说话人相关任务的性能,证明了它们在编码说话人信息中的关键作用。

关键词

引用

@article{arxiv.2506.21712,
  title  = {Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers},
  author = {Tzu-Quan Lin and Hsi-Chun Cheng and Hung-yi Lee and Hao Tang},
  journal= {arXiv preprint arXiv:2506.21712},
  year   = {2025}
}