自监督语音与说话人模型学到了什么?来自跨模型逐层分析的新发现
计算与语言
2024-02-01 v1 声音
音频与语音处理
摘要
自监督学习 (SSL) 在学习有意义的语音表征方面引起了越来越多的关注。语音 SSL 模型(如 WavLM)采用掩码预测训练来编码通用表征。相比之下,以基于 DINO 的模型为代表的说话人 SSL 模型,采用话语级训练目标主要用于说话人表征。理解这些模型如何表征信息对于提升模型的效率与有效性至关重要。与对语音 SSL 的各种分析不同,对于说话人 SSL 捕获了什么信息及其表征与语音 SSL 或其他全监督说话人模型有何不同,目前的研究有限。本文探讨了这些基本问题。我们通过将 SUPERB 评估探针任务应用于语音和说话人 SSL 模型,探索了它们捕获各种语音特性的能力。我们还检查了每个任务主要利用了哪些层,以识别语音表征方式的差异。此外,我们进行了直接比较,以测量模型内部和跨模型各层之间的相似性。我们的分析揭示:1) 表征内容信息的能力与增强的说话人表征有些不相关;2) 语音 SSL 模型的特定层会在一定程度上特化于捕获语言信息;3) 说话人 SSL 模型倾向于忽略语言信息,但表现出更复杂的说话人表征。
引用
@article{arxiv.2401.17632,
title = {What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis},
author = {Takanori Ashihara and Marc Delcroix and Takafumi Moriya and Kohei Matsuura and Taichi Asami and Yusuke Ijima},
journal= {arXiv preprint arXiv:2401.17632},
year = {2024}
}
备注
Accepted at ICASSP 2024