中文

基于 CLIP 微调的开放词汇 X 光禁忌物品检测

计算机视觉与模式识别 2024-06-18 v1 人工智能 计算机与社会

摘要

X 光禁忌物品检测是安检的 essential 组成部分,禁忌物品的类别随最新法律不断增加。以往的研究都 focus 于封闭场景,只能识别用于训练的已知类别,学习新类别时往往需要耗时且工作量大的标注,导致实际应用受限。尽管视觉语言模型(如 CLIP)的成功为开放场景下的 X 光禁忌物品检测提供了新思路,但直接将 CLIP 应用于 X 光领域会因 X 光数据与 CLIP 预训练所用常规数据之间的领域迁移导致性能显著下降。为解决上述挑战,本文在 X 光安检领域引入基于蒸馏的开放词汇目标检测(OVOD)任务,通过扩展 CLIP 在特定 X 光领域学习视觉表征,旨在检测基于训练所用基础类别之上的 novel prohibited item categories。具体而言,我们提出了 X 光特征适配器,并将其应用于 OVOD 框架内的 CLIP,以开发出 OVXD 模型。X 光特征适配器包含三个瓶颈架构的适配子模块,简单却能高效地将 X 光领域的新知识与原始知识集成,进一步缩小领域差距并促进 X 光图像与文本概念之间的对齐。在 PIXray 和 PIDray 数据集上的大量实验表明,所提出的方法在 X 光场景下检测 novel 类别的性能优于其他基线 OVOD 方法,分别在 PIXray 和 PIDray 上相较于前所未有的表现提升了 15.2 AP50 和 1.5 AP50,达到 21.0 AP50 和 27.8 AP50。

关键词

引用

@article{arxiv.2406.10961,
  title  = {Open-Vocabulary X-ray Prohibited Item Detection via Fine-tuning CLIP},
  author = {Shuyang Lin and Tong Jia and Hao Wang and Bowen Ma and Mingyuan Li and Dongyue Chen},
  journal= {arXiv preprint arXiv:2406.10961},
  year   = {2024}
}