One-D-Piece:图像分词器与可控质量压缩
计算机视觉与模式识别
2025-01-20 v1 机器学习
摘要
当前图像分词方法需要大量标记来捕获图像中包含的信息。虽然信息量在不同图像之间存在差异,但大多数图像分词器只支持固定长度分词,导致标记分配效率低下。本研究引入一种名为“尾部标记丢弃”(Tail Token Drop)的简单而有效的正则化机制,以实现可变长度分词和质量可控机制的离散图像分词器。该方法鼓励关键信息集中在标记序列的开头,从而支持可变分词,同时保持最先进的重建质量。我们在多个重建质量指标上评估了该分词器,发现其在更小的字节大小下,感知质量显著优于现有的可控质量压缩方法,包括 JPEG 和 WebP。此外,我们在各种下游计算机视觉任务上评估了该分词器,包括图像分类、目标检测、语义分割和深度估计,确认其在众多应用中的适应性优于其他可变速率方法。我们的举措展示了可变长度离散图像分词的灵活性,确立了压缩效率和重建性能的新范式。最后,我们通过详细分析验证了尾部标记丢弃的有效性。
引用
@article{arxiv.2501.10064,
title = {One-D-Piece: Image Tokenizer Meets Quality-Controllable Compression},
author = {Keita Miwa and Kento Sasaki and Hidehisa Arai and Tsubasa Takahashi and Yu Yamaguchi},
journal= {arXiv preprint arXiv:2501.10064},
year = {2025}
}
备注
Our Project Page: https://turingmotors.github.io/one-d-piece-tokenizer