沉默胜于言语:利用静音存储说话人信息的自监督模型
机器学习
2022-05-10 v1 声音
音频与语音处理
摘要
自监督学习(SSL)近来取得重大进展。SSL 语音模型在广泛下游任务上取得不错性能,表明其从语音中提取了不同方面的信息。然而,SSL 模型如何在不互相干扰的情况下于隐藏表示中存储各类信息仍知之甚少。以近期成功的 SSL 模型 HuBERT 为例,我们探究 SSL 模型如何处理并在表示中存储说话人信息。我们发现 HuBERT 将说话人信息存储于波形中对应静音位置处的表示中。有若干证据:(1) 我们发现波形中静音部分更多的语音具有更好的说话人识别(SID)准确率。(2) 若使用整段语音进行 SID,静音部分始终对 SID 任务贡献更多。(3) 若仅使用语音部分片段的表示进行 SID,静音部分的准确率高于其他部分。我们的发现不仅有助于更好地理解 SSL 模型,也提升了性能。通过向原始波形简单添加静音,HuBERT 在 SID 上的准确率提升了近 2%。
引用
@article{arxiv.2205.03759,
title = {Silence is Sweeter Than Speech: Self-Supervised Model Using Silence to Store Speaker Information},
author = {Chi-Luen Feng and Po-chun Hsu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2205.03759},
year = {2022}
}