DetGPT:通过推理检测你所需要的目标
计算机视觉与模式识别
2023-05-25 v2 人工智能
摘要
近年来,得益于大语言模型(LLMs)的发展,计算机视觉领域取得了显著进步。这些模型实现了更高效、更精细的人机交互,为模糊人类与机器智能界限的新技术铺平了道路。在本文中,我们引入一种称为基于推理的物体检测新范式。与依赖特定物体名称的传统物体检测方法不同,我们的方法使用户能够通过自然语言指令与系统交互,从而实现更高水平的交互性。我们提出的方法称为DetGPT,它利用最先进的多模态模型与开放词汇物体检测器,在用户指令与视觉场景的上下文中执行推理。这使得DetGPT能够根据用户表达的意愿自动定位感兴趣物体,即使该物体未被明确提及。例如,若用户表达想要冷饮,DetGPT可分析图像、识别冰箱,并利用其对冰箱典型内容的认知来定位饮料。这种灵活性使我们的系统可广泛应用于从机器人与自动化到自动驾驶的众多领域。总体而言,我们提出的范式与DetGPT展示了更精细、更直观的人机交互潜力。我们希望我们提出的范式与方法能为学界提供启发,并为更具交互性与通用性的物体检测系统打开大门。我们的项目页面发布于detgpt.github.io。
引用
@article{arxiv.2305.14167,
title = {DetGPT: Detect What You Need via Reasoning},
author = {Renjie Pi and Jiahui Gao and Shizhe Diao and Rui Pan and Hanze Dong and Jipeng Zhang and Lewei Yao and Jianhua Han and Hang Xu and Lingpeng Kong and Tong Zhang},
journal= {arXiv preprint arXiv:2305.14167},
year = {2023}
}