基于语言模型指令的开放词表检测:LaMI-DETR
计算机视觉与模式识别
2024-07-19 v2
摘要
现有方法通过利用视觉-语言模型(Vision-Language Models, VLMs)如CLIP等强大的开放词表识别能力来增强开放词表目标检测,但会出现两个主要挑战:(1)概念表示不足,CLIP文本空间中的类别名称缺乏文本和视觉知识;(2)对基座类别过拟合,开放词表知识在从VLMs迁移到检测器时偏向于基座类别。为此,我们提出了语言模型指令(Language Model Instruction, LaMI)策略,利用视觉概念之间的关系,并在一个简单而有效的DETR类检测器中应用这些关系,称为LaMI-DETR。LaMI利用GPT构建视觉概念,并利用T5探讨类别之间的视觉相似性。这些跨类别关系既能细化概念表示,又能避免对基座类别的过拟合。全面实验验证了我们方法在不依赖外部训练资源的情况下的优异性能。LaMI-DETR在OV-LVIS上的罕见框平均精度(rare box AP)达到了43.4,超越了前一最佳方法的7.8个罕见框平均精度。
引用
@article{arxiv.2407.11335,
title = {LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction},
author = {Penghui Du and Yu Wang and Yifan Sun and Luting Wang and Yue Liao and Gang Zhang and Errui Ding and Yan Wang and Jingdong Wang and Si Liu},
journal= {arXiv preprint arXiv:2407.11335},
year = {2024}
}
备注
ECCV2024