中文

随机化 MLP 正则化提升 DINOv2 的域适应性与可解释性

计算机视觉与模式识别 2025-11-11 v1 人工智能

摘要

Vision Transformers (ViTs) 如 DINOv2 在跨域任务中表现优异,但常以方式降低注意力和特征图的可解释性。这种挑战在医学成像中尤为突出,域迁移会同时影响性能和透明度。本文引入随机化 MLP (Randomized-MLP, RMLP) 正则化,这是一种基于对比学习的方法,旨在鼓励更语义一致的表征。我们在微调 DINOv2 以适应医学和自然图像模态时使用 RMLP,结果表明它在保持或提升下游性能的同时,生成更具可解释性的注意力图。我们还对 RMLP 进行数学分析,为增进对 ViT 模型及对比学习理解提供了洞见。

关键词

引用

@article{arxiv.2511.05509,
  title  = {Randomized-MLP Regularization Improves Domain Adaptation and Interpretability in DINOv2},
  author = {Joel Valdivia Ortega and Lorenz Lamm and Franziska Eckardt and Benedikt Schworm and Marion Jasnin and Tingying Peng},
  journal= {arXiv preprint arXiv:2511.05509},
  year   = {2025}
}