通过编码率正则化简化 DINO
计算机视觉与模式识别
2025-02-17 v1 人工智能
摘要
DINO 和 DINOv2 是两个在大规模无标签图像数据上学习表征的模型家族,其学习的表征常常能够实现图像分类和分割等下游任务的state-of-the-art性能。然而,它们采用许多实验性设计选择,其训练管道高度复杂且不稳定——需要精确调谐许多超参数以确保表征不塌陷,这给改进它们或将其适应到新领域带来了 considerable 难度。在本工作中,我们认为我们可以消除大多数这种动机存疑的预训练管道,仅需在损失函数中添加显式的编码率项即可避免表征的塌陷。结果,我们获得了 DINO 和 DINOv2 的高度简化变体,分别称为 SimDINO 和 SimDINOv2。令人惊讶的是,这些简化模型对不同的设计选择(如网络架构和超参数)更稳健,并且它们学习到的甚至更高质量的表征(以下游任务性能衡量),为相应的 DINO 和 DINOv2 模型提供了 Pareto 改进。本工作凸显了利用简化设计原则来提高深度学习实践的潜力。
引用
@article{arxiv.2502.10385,
title = {Simplifying DINO via Coding Rate Regularization},
author = {Ziyang Wu and Jingyuan Zhang and Druv Pai and XuDong Wang and Chandan Singh and Jianwei Yang and Jianfeng Gao and Yi Ma},
journal= {arXiv preprint arXiv:2502.10385},
year = {2025}
}
备注
17 pages, 5 figures