通过视觉-语言嵌入对齐实现零样本目标检测
计算机视觉与模式识别
2022-08-30 v2
摘要
近期方法表明,直接在大规模图像-文本对集合上训练深度神经网络,可实现各类识别任务的零样本迁移。一个核心问题是如何将其推广到目标检测,后者涉及非语义的定位任务与语义的分类任务。为解决此问题,我们引入一种视觉-语言嵌入对齐方法,将 CLIP 等预训练模型的泛化能力迁移至 YOLOv5 等目标检测器。我们构造了一个损失函数,使预训练模型 CLIP 的图像与文本嵌入能和检测器修改后的语义预测头相对齐。借助该方法,我们训练出的目标检测器在 COCO、ILSVRC 和 Visual Genome 零样本检测基准上取得了 SOTA 性能。推理时,我们的模型可适配检测任意数量的物体类别而无需额外训练。我们还发现标准目标检测缩放能良好迁移至本方法,并在 YOLOv5 各规模模型与 YOLOv3 模型上观察到一致的提升。最后,我们开发了一种自标注方法,无需额外图像或标签即可显著提升分数。
引用
@article{arxiv.2109.12066,
title = {Zero-shot Object Detection Through Vision-Language Embedding Alignment},
author = {Johnathan Xie and Shuai Zheng},
journal= {arXiv preprint arXiv:2109.12066},
year = {2022}
}
备注
Code: https://github.com/Johnathan-Xie/ZSD-YOLO