VESSA: 面向视觉基础模型的基于视频的以对象为中心的自监督适应
计算机视觉与模式识别
2025-10-27 v1 人工智能
机器学习
摘要
基础模型通过大规模预训练和监督微调,在多种任务上展现出强大性能,推动了计算机视觉的发展。然而,在存在分布偏移和标签稀缺的领域,当监督微调不可行时,它们可能表现不佳。虽然持续的自监督学习进行模型适应在生成式语言模型中很常见,但这一策略对于以视觉为中心的编码器模型尚未被证明有效。为了应对这一挑战,我们提出了一种新颖的视觉基础模型自监督微调方案,该方案无需标注,仅利用短的多视角以对象为中心的视频,即可将模型适应到新领域。我们的方法称为VESSA:面向视觉基础模型的基于视频的以对象为中心的自监督适应。VESSA的训练技术基于自蒸馏范式,其中关键在于仔细调整预测头并部署参数高效的适应技术——否则,模型可能会迅速遗忘其预训练知识并达到退化状态。VESSA显著受益于从以对象为中心的视频的不同帧中获取的多视角对象观测,从而无需标注即可高效学习对多种拍摄条件的鲁棒性。通过在2个数据集上对3个视觉基础模型进行的全面实验,VESSA在下游分类任务中相较于基础模型和先前的适应方法展现出一致的改进。代码已在 https://github.com/jesimonbarreto/VESSA 公开。
引用
@article{arxiv.2510.20994,
title = {VESSA: Video-based objEct-centric Self-Supervised Adaptation for Visual Foundation Models},
author = {Jesimon Barreto and Carlos Caetano and André Araujo and William Robson Schwartz},
journal= {arXiv preprint arXiv:2510.20994},
year = {2025}
}
备注
Conference on Neural Information Processing Systems (NeurIPS 2025)