中文

自监督语音表示中说话人特定属性的大规模探测分析

音频与语音处理 2026-03-06 v3 声音

摘要

提高语音自监督学习(SSL)中可解释性对于开发可靠的 SSL 语音处理系统至关重要。本研究通过对 11 种语音 SSL 模型进行大规模探测分析,探讨了这些模型如何编码说话人特定信息,并将身份信息分解为声学属性、韵律属性和语义属性。结果确认了一种普遍的层次结构:底层编码基本声学特征,中层综合抽象特征。关键在于,最终层纯粹抽象语言内容的共识受到了挑战。发现更大规模的模型在深层仍能恢复说话人身份。此外,发现语音 SSL 模型的中间表示捕获动态韵律的能力优于专用说话人嵌入。这些见解解码了 SSL 模型内部的复杂机制,为选择可解释且任务最优的表示提供了指导方针。

关键词

引用

@article{arxiv.2501.05310,
  title  = {A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations},
  author = {Aemon Yat Fei Chiu and Kei Ching Fung and Roger Tsz Yeung Li and Jingyu Li and Tan Lee},
  journal= {arXiv preprint arXiv:2501.05310},
  year   = {2026}
}

备注

Under review