中文

BiRQ:面向自监督语音识别的双层自标签随机量化

计算与语言 2025-09-22 v1 声音 音频与语音处理

摘要

语音是一种丰富的信号,标注的音频文本对是稀缺资源,使得自监督学习对于可扩展的表征学习至关重要。在语音自监督学习中,生成既信息丰富又高效的伪标签是一个核心挑战:强标签(如HuBERT中使用的标签)可提升下游性能,但依赖外部编码器和多阶段管道;而高效方法如BEST-RQ实现简单,却牺牲了标签的强度。我们提出BiRQ,一种双层自监督学习框架,融合BEST-RQ的高效性与HuBERT式标签增强的细化优势。其核心思想是复用模型本身作为伪标签生成器:通过随机投影量化器对中间表征进行离散化,以产生增强标签;而直接来自原始输入的锚定标签则稳定训练,防止模型崩溃。训练被形式化为高效的一阶双层优化问题,通过可微Gumbel-softmax选择实现端到端求解。这一设计无需外部标签编码器,降低内存开销,实现了端到端的迭代标签细化。BiRQ在各种数据集上均优于BEST-RQ,同时保持低复杂度和计算效率。我们在包括960小时LibriSpeech、150小时AMI会议及5000小时YODAS等数据集上进行验证,证明其在保持高效的同时持续优于BEST-RQ。

关键词

引用

@article{arxiv.2509.15430,
  title  = {BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition},
  author = {Liuyuan Jiang and Xiaodong Cui and Brian Kingsbury and Tianyi Chen and Lisha Chen},
  journal= {arXiv preprint arXiv:2509.15430},
  year   = {2025}
}

备注

5 pages including reference