ATAS:面向增强开放词汇密集预测的任意到任意自蒸馏
计算机视觉与模式识别
2025-10-02 v2
摘要
视觉语言模型如CLIP最近通过实现对广泛视觉概念的识别,推动了开放词汇密集预测任务的发展。然而,CLIP在细粒度、区域级理解方面仍存在挑战,限制了其在密集预测任务中的效能。我们识别了两大关键因素以解决此限制:语义一致性和细粒度视觉语言对齐。当前方法往往在提升细粒度对齐方面以牺牲语义一致性为代价,常依赖额外模块或监督微调。为此,我们提出任意到任意自蒸馏(ATAS)方法,通过利用模型在所有表示层级上的自身知识,同时提升语义一致性和细粒度对齐。与先前方法不同,ATAS仅使用无标签图像和内部自蒸馈过程,以 refinement 方式优化CLIP视觉编码器的表示,既保持局部语义一致性,又加强局部细节识别。在开放词汇目标检测和语义分割基准测试上,ATAS实现了显著的性能提升,超越基线CLIP模型。这些结果验证了我们方法的有效性,强调在高级开放词汇密集预测中,同时保持语义一致性和细粒度对齐的重要性。
引用
@article{arxiv.2506.08678,
title = {ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense Prediction},
author = {Juan Yeo and Soonwoo Cha and Jiwoo Song and Hyunbin Jin and Taesup Kim},
journal= {arXiv preprint arXiv:2506.08678},
year = {2025}
}
备注
Accepted at ICCV25