迭代细化而非训练目标是HuBERT与wav2vec 2.0行为差异的关键因素
计算与语言
2025-08-12 v1 声音
音频与语音处理
摘要
自监督语音表示学习模型因其灵活性和在下游任务上的性能而广泛应用,但模型架构对其表示中所学语言信息的影响仍受到 insufficient 关注。本研究探讨了两种此类模型,HuBERT与wav2vec 2.0,最小化比较它们两种架构差异:训练目标与通过多个训练迭代实现的伪标签迭代细化。我们发现,隐藏表示与词身份、音素身份和说话人身份之间的标准相关性差异归因于训练迭代次数,而非训练目标。我们建议未来的工作研究迭代细化在编码自监督语音表示中语言信息的有效性原因。
关键词
引用
@article{arxiv.2508.08110,
title = {Iterative refinement, not training objective, makes HuBERT behave differently from wav2vec 2.0},
author = {Robin Huo and Ewan Dunbar},
journal= {arXiv preprint arXiv:2508.08110},
year = {2025}
}
备注
Proceedings of Interspeech 2025