中文

基于预训练 Transformer 的字节级多模态数据压缩

机器学习 2025-05-26 v2 人工智能 信息论 math.IT

摘要

基础模型是强大的数据压缩器,但在考虑其参数大小后,其压缩比率不如标准压缩算法差。单纯降低参数数量并不一定有帮助,因为这会恶化预测,从而影响压缩。我们进行了大规模经验研究,以寻找预训练 vanilla transformer 在何处能够实现具有竞争力的压缩比。为此,我们在 165GB 的原始字节序列上训练模型,序列来自文本、图像或音频数据(以及这三者的所有可能组合),然后压缩来自每个模态的 1GB 外部分布 (OOD) 数据。我们发现,相对较小的模型(数百万参数)可以超过标准通用压缩算法(gzip、LZMA2)甚至特定于领域的压缩器(PNG、JPEG-XL、FLAC)——即使考虑参数大小也如此。例如,我们在 OOD 音频数据上实现了最低的压缩比 0.49(相对于 FLAC 的 0.54)。我们进行了 extensive ablation 和 hyperparameter sweeps 来研究模型和数据集规模的影响,并研究了单模态 versus 多模态训练的效果。我们发现,即使是小模型也能在多个模态上训练得很好,但与大规模基础模型不同,针对未见模态的迁移通常较弱。

关键词

引用

@article{arxiv.2410.05078,
  title  = {Compression via Pre-trained Transformers: A Study on Byte-Level Multimodal Data},
  author = {David Heurtel-Depeiges and Anian Ruoss and Joel Veness and Tim Genewein},
  journal= {arXiv preprint arXiv:2410.05078},
  year   = {2025}
}