学习超越名词概念的伪标签器以用于开放词汇目标检测
计算机视觉与模式识别
2023-12-05 v1
摘要
开放词汇目标检测(OVOD)作为实现类人视觉智能的关键步骤,近期受到了广泛关注。现有的 OVOD 方法通过将视觉-语言预训练模型中任意概念的知识迁移到检测器,将目标词汇从预定义类别扩展到开放世界。尽管先前的方法取得了显著成功,但它们存在间接监督或可迁移概念受限的问题。在本文中,我们提出了一种简单而有效的方法,直接学习任意概念的区域-文本对齐。具体而言,所提出的方法旨在学习任意图像到文本的映射,以对任意概念进行伪标签标注,命名为任意概念伪标签标注(PLAC)。所提出的方法在名词概念的标准 OVOD 基准上表现出有竞争力的性能,并在任意概念的指代表达理解基准上取得了大幅提升。
引用
@article{arxiv.2312.02103,
title = {Learning Pseudo-Labeler beyond Noun Concepts for Open-Vocabulary Object Detection},
author = {Sunghun Kang and Junbum Cha and Jonghwan Mun and Byungseok Roh and Chang D. Yoo},
journal= {arXiv preprint arXiv:2312.02103},
year = {2023}
}