DinoSR:用于自监督语音表征学习的自蒸馏与在线聚类
计算与语言
2024-01-17 v2
摘要
本文提出用于自监督语音表征学习的自蒸馏与在线聚类方法(DinoSR),其结合了掩码语言建模、自蒸馏与在线聚类。我们表明这些概念相互补充,并构成了一个强大的语音表征学习模型。DinoSR首先用教师网络从输入音频中提取上下文嵌入,随后在嵌入上运行在线聚类系统以产生机器发现的音素表,最后使用离散化令牌引导学生网络。我们表明DinoSR在多个下游任务中超越了先前的最优性能,并对模型及所学离散单元提供了详细分析。
引用
@article{arxiv.2305.10005,
title = {DinoSR: Self-Distillation and Online Clustering for Self-supervised Speech Representation Learning},
author = {Alexander H. Liu and Heng-Jui Chang and Michael Auli and Wei-Ning Hsu and James R. Glass},
journal= {arXiv preprint arXiv:2305.10005},
year = {2024}
}