SeiT++: 掩码标记建模提升存储高效训练
计算机视觉与模式识别
2024-08-13 v5
摘要
深度神经网络(DNN)模型的最新进展显著提高了计算机视觉任务的性能。然而,实现高度泛化和高性能的视觉模型需要大规模数据集,导致巨大的存储需求。这个存储挑战是扩展模型的关键瓶颈。最近SeiT的突破性工作提出使用向量量化(VQ)特征向量(即token)作为视觉分类的网络输入。该方法仅使用1%的存储就达到了全像素图像训练模型90%的性能。虽然SeiT需要标记数据,但其在完全监督学习之外的场景中的潜力尚未被充分挖掘。在本文中,我们通过集成掩码标记建模(MTM)进行自监督预训练来扩展SeiT。认识到自监督方法由于缺乏标签通常需要更多数据,我们引入了TokenAdapt和ColorAdapt。这些方法促进了全面的token友好数据增强,有效解决了自监督学习增加的数据需求。我们在各种场景下评估了我们的方法,包括存储高效的ImageNet-1k分类、细粒度分类、ADE-20k语义分割和鲁棒性基准。实验结果表明,在不同实验中性能持续提升,验证了我们方法的有效性。代码可在https://github.com/naver-ai/seit获取。
引用
@article{arxiv.2312.10105,
title = {SeiT++: Masked Token Modeling Improves Storage-efficient Training},
author = {Minhyun Lee and Song Park and Byeongho Heo and Dongyoon Han and Hyunjung Shim},
journal= {arXiv preprint arXiv:2312.10105},
year = {2024}
}
备注
Accepted to ECCV 2024. First two authors contributed equally