中文

BRIDLE:带量化的广义自监督学习

机器学习 2025-02-05 v1 计算机视觉与模式识别

摘要

自监督学习一直是一种强大的方法,用于从各个领域的无标签数据中学习有意义的表示,从而减少对大型标注数据集的依赖。受BERT在自然语言处理中成功捕获深层双向上下文的启发,类似的框架已被适配到其他模态,例如音频,其中像BEATs这样的模型使用矢量量化(VQ)将双向训练范式扩展到音频信号。然而,这些框架面临挑战,特别是它们依赖于单一码本进行量化,这可能无法捕捉信号的复杂、多面性。此外,码本利用效率低下导致码向量未被充分利用。为了解决这些局限性,我们引入了BRIDLE(双向残差量化交织离散学习编码器),这是一个自监督编码器预训练框架,它将残差量化(RQ)整合到双向训练过程中,并泛化用于音频、图像和视频的预训练。通过使用多个分层码本,RQ能够在潜在空间中实现细粒度离散化,从而提升表示质量。BRIDLE涉及编码器和分词器之间的交织训练过程。我们使用分类基准在音频理解任务上评估BRIDLE,取得了最先进的结果,并在图像分类和视频分类任务上展示了有竞争力的性能,表明在下游性能上相比传统VQ方法有一致的改进。

关键词

引用

@article{arxiv.2502.02118,
  title  = {BRIDLE: Generalized Self-supervised Learning with Quantization},
  author = {Hoang M. Nguyen and Satya N. Shukla and Qiang Zhang and Hanchao Yu and Sreya D. Roy and Taipeng Tian and Lingjiong Zhu and Yuchen Liu},
  journal= {arXiv preprint arXiv:2502.02118},
  year   = {2025}
}