GQ-VAE:一种用于学习变长 token 的门控量化 VAE
机器学习
2025-12-29 v1
摘要
尽管大多数前沿模型仍使用基于频率的确定性分词算法(如 byte-pair encoding (BPE)),但近期在设计可学习的神经分词器方面已有大量工作。然而,这些方案通常会增加底层语言模型的复杂性,并迫使架构进行大幅修改,使其难以在大规模场景下实现。为克服这些挑战,我们提出了门控量化变分自编码器(gated quantized variational autoencoder, GQ-VAE),这是一种可独立预训练的新型架构,可作为现有分词器的直接替代品。该架构的关键创新在于学习编码变长离散 token。与标准的 VQ-VAE 分词器相比,GQ-VAE 提升了压缩和语言建模性能,并逼近了 BPE 的压缩率和语言建模性能。有趣的是,如果我们使用词汇表更小的 BPE,使得 GQ-VAE 和 BPE 之间的压缩率等价,我们发现 GQ-VAE 能改善下游语言模型的学习。最后,我们讨论了未来工作中有待探索的几个激动人心的方向。代码可在 https://github.com/Theo-Datta-115/gq-vae 获取。
引用
@article{arxiv.2512.21913,
title = {GQ-VAE: A gated quantized VAE for learning variable length tokens},
author = {Theo Datta and Kayla Huang and Sham Kakade and David Brandfonbrener},
journal= {arXiv preprint arXiv:2512.21913},
year = {2025}
}