MelHuBERT:基于梅尔谱图的简化 HuBERT
计算与语言
2024-09-02 v3 机器学习
声音
音频与语音处理
摘要
自监督模型在学习可泛化至各类下游任务的语音表征方面取得了巨大成功。然而,大多数自监督模型需要大量计算资源和多块 GPU 进行训练,严重阻碍了自监督学习的发展。为降低训练计算量,我们重访了高度成功的自监督模型 HuBERT 的训练过程。我们改进并简化了若干关键组件,包括损失函数、输入表征和多阶段训练。我们的模型 MelHuBERT 能够在音素识别、说话人识别和自动语音识别上取得优于 HuBERT 的性能,同时节省 31.2% 的预训练时间,或等价地每少 33.5% 的 MACs(以一秒语音计)。代码与预训练模型见 https://github.com/nervjack2/MelHuBERT。
引用
@article{arxiv.2211.09944,
title = {MelHuBERT: A simplified HuBERT on Mel spectrograms},
author = {Tzu-Quan Lin and Hung-yi Lee and Hao Tang},
journal= {arXiv preprint arXiv:2211.09944},
year = {2024}
}
备注
ASRU 2023