面向自监督学习的模块化且灵活的 DINO-MX 框架
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
视觉基础模型 (VFM) 通过自监督方法推动了表征学习的进展。然而,现有训练管道往往缺乏灵活性、领域特定或计算成本高昂,限制了其在不同领域和资源环境下的可用性。DINO-MX 是一个模块化且可扩展的训练框架,将 DINO、DINOv2 和 DINOv3 的核心原则整合到统一的配置驱动系统中。它支持多种基于 Transformer 的架构,完全兼容 Hugging Face 生态系统。该框架包括多种训练策略,如低秩适应 (LoRA)、层冻结和知识蒸馏,同时支持通过分布式数据并行 (DDP) 和完全分片数据并行 (FSDP) 实现分布式训练。DINO-MX 设计用于自然图像和特殊数据类型,包括单通道和多通道图像。在多样化数据集上的实验结果表明,DINO-MX 虽保持竞争性能,却显著降低了计算成本。此外,它提供可解释性工具和基于标签的数据增强方法,无需额外的检测或分割头即可提高注意力基于的局部分辨。DINO-MX 为在广泛的研究和实际应用中开发、调整和基准测试自监督视觉模型提供了可复现且可扩展的基础。
关键词
引用
@article{arxiv.2511.01610,
title = {DINO-MX: A Modular & Flexible Framework for Self-Supervised Learning},
author = {Mahmut Selman Gokmen and Cody Bumgardner},
journal= {arXiv preprint arXiv:2511.01610},
year = {2025}
}