中文

使用大型视觉语言模型进行零样态场景理解以实现自动目标识别

计算机视觉与模式识别 2025-01-14 v1

摘要

自动目标识别(ATR)在导航和监视等任务中发挥着关键作用,其中安全性和准确性至关重要。在军事等极端场景下,这些因素常常因未知地形、环境条件和新颖目标类别的存在而受到挑战。当前的对象检测器,包括开放世界检测器,缺乏对新颖目标或未知环境中 confident recognition 的能力,因为它们未曾接触过这些新情形。然而,大型视觉语言模型(LVLMs)具有能够以零样态方式识别不同条件下目标的涌现特性。尽管如此,LVLMs 在场景内有效定位目标方面仍面临挑战。为解决这些局限性,我们提出了一种新型管道,将开放世界检测器的检测能力与 LVLMs 的 recognition confidence 结合,构建用于零样态 ATR 的 novel class 和 unknown domain 的 robust system。本研究比较了 various LVLMs 识别军事车辆的性能,这些车辆常常在训练数据集中被低估。此外,我们检验了距离范围、模态性和提示方法等因素对 recognition performance 的影响,为开发更可靠的用于 novel conditions and classes 的 ATR 系统提供了见解。

关键词

引用

@article{arxiv.2501.07396,
  title  = {Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models},
  author = {Yasiru Ranasinghe and Vibashan VS and James Uplinger and Celso De Melo and Vishal M. Patel},
  journal= {arXiv preprint arXiv:2501.07396},
  year   = {2025}
}