面向大词汇量目标检测器的领域自适应
计算机视觉与模式识别
2024-05-13 v2
摘要
大词汇量目标检测器(LVD)旨在检测众多类别的目标,它们学习超强的目标性特征,在应用于各种下游数据时能够准确定位目标。然而,由于数据分布和目标词汇的领域差异,LVD 在识别已定位目标时常常遇到困难。另一方面,最近的视觉-语言基础模型(如 CLIP)展示了卓越的开放词汇识别能力。本文提出 KGD,一种知识图谱蒸馏技术,利用 CLIP 中隐含的知识图谱(KG)来有效地将 LVD 适配到各种下游领域。KGD 包含两个连续阶段:1)KG 提取,利用 CLIP 将下游领域数据编码为节点,将其特征距离编码为边,构建显式继承 CLIP 中丰富语义关系的 KG;2)KG 封装,将提取的 KG 迁移到 LVD 中,以实现准确的跨领域目标分类。此外,KGD 可以独立提取视觉和文本 KG,为各种下游领域检测任务中的目标定位和目标分类提供互补的视觉和语言知识。在多个广泛采用的检测基准上的实验表明,KGD 始终以较大幅度优于当前最先进的方法。
引用
@article{arxiv.2401.06969,
title = {Domain Adaptation for Large-Vocabulary Object Detectors},
author = {Kai Jiang and Jiaxing Huang and Weiying Xie and Jie Lei and Yunsong Li and Ling Shao and Shijian Lu},
journal= {arXiv preprint arXiv:2401.06969},
year = {2024}
}