MSR-HuBERT:面向多采样率适配的自监督预训练
声音
2026-03-25 v1 人工智能
摘要
自监督学习(SSL)已在语音处理领域取得显著进展。然而,现有语音 SSL 方法通常假设单一采样率,难以处理因时间分辨率不匹配而导致的混合率数据。为此,我们提出 MSRHuBERT—a 一种多采样率自适应预训练方法。基于 HuBERT,我们替换其单率下采样 CNN 为多采样率自适应下采样 CNN,该网络可将不同采样率的原始波形映射到统一的时间分辨率,而无需重采样。此设计使混合率预训练和微调成为统一可行。实验覆盖 16 到 48 kHz 范围,MSRHuBERT 在语音识别和全带语音重建任务上超越 HuBERT,既保留了高频细节,又建模了低频语义结构。此外,MSRHuBERT 保持 HuBERT 的遮盖预测目标和 Transformer 编码器,因此现有的分析方法和改进措施可直接适用于。
引用
@article{arxiv.2603.23048,
title = {MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates},
author = {Zikang Huang and Meng Ge and Tianrui Wang and Xuanchen Li and Xiaobao Wang and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2603.23048},
year = {2026}
}