HuBERTopic:利用主题模型通过自监督增强HuBERT的语义表示
声音
2023-10-09 v1 计算与语言
摘要
近来,自监督表示学习(SSRL)方法在各种下游任务中的效用已得到确认。以HuBERT和WavLM为代表的许多此类模型,使用从谱特征或模型自身表示特征生成的伪标签。从以往研究可知,伪标签包含语义信息。然而,作为HuBERT学习准则的掩码预测任务侧重于局部上下文信息,可能未能有效利用说话人、语音主题等全局语义信息。本文提出一种丰富HuBERT语义表示的新方法。我们将主题模型应用于伪标签,为每一条语音生成主题标签。通过使用主题标签作为教师信号,向HuBERT添加辅助主题分类任务。这使得额外的全局语义信息得以以无监督方式被纳入。实验结果表明,我们的方法在大多数任务中取得与基线相当或更好的性能,包括自动语音识别以及SUPERB八项任务中的五项。此外,我们发现主题标签包含关于语音的多种信息,如性别、说话人及其主题。这凸显了我们的方法在捕捉多方面语义细微差别上的有效性。
引用
@article{arxiv.2310.03975,
title = {HuBERTopic: Enhancing Semantic Representation of HuBERT through Self-supervision Utilizing Topic Model},
author = {Takashi Maekaku and Jiatong Shi and Xuankai Chang and Yuya Fujita and Shinji Watanabe},
journal= {arXiv preprint arXiv:2310.03975},
year = {2023}
}
备注
Submitted to IEEE ICASSP 2024