InstructDET:以通用指令多样化指称目标检测
人工智能
2024-03-12 v5 计算机视觉与模式识别
摘要
我们提出 InstructDET,一种以数据为中心的指称目标检测(ROD)方法,基于用户指令定位目标对象。虽然源自指称表达式(REC),我们所利用的指令被极大多样化以涵盖与目标检测相关的常见用户意图。对于一张图像,我们生成大量指向每一个单独对象以及多个对象不同组合的指令。每条指令及其对应的对象边界框(bbxs)构成一个训练数据对。为涵盖常见检测表达,我们引入新兴视觉-语言模型(VLM)和大语言模型(LLM),在文本提示与对象 bbxs 引导下生成指令,由于基础模型的泛化能力可有效产生类人表达(例如描述对象属性、类别与关系)。我们将构建的数据集命名为 InDET。它包含来自基础模型的图像、bbxs 与通用指令。我们的 InDET 由现有 REC 数据集与目标检测数据集发展而来,具有扩展潜力:任何带对象 bbxs 的图像均可通过我们的 InstructDET 方法被纳入。通过使用 InDET 数据集,我们展示一个常规 ROD 模型在标准 REC 数据集与我们的 InDET 测试集上均超越现有方法。我们这种利用基础模型自动扩展数据的以数据为中心的方法 InstructDET,指向了一个有前景的领域:ROD 可被极大多样化以执行常见目标检测指令。
引用
@article{arxiv.2310.05136,
title = {InstructDET: Diversifying Referring Object Detection with Generalized Instructions},
author = {Ronghao Dang and Jiangyan Feng and Haodong Zhang and Chongjian Ge and Lin Song and Lijun Gong and Chengju Liu and Qijun Chen and Feng Zhu and Rui Zhao and Yibing Song},
journal= {arXiv preprint arXiv:2310.05136},
year = {2024}
}
备注
29 pages (include Appendix) Published in ICLR