中文

将语言衍生的外观要素与视觉线索集成于行人检测

计算机视觉与模式识别 2024-05-01 v3

摘要

大型语言模型(LLMs)已展现出理解关于实例外观知识的上下文与语义信息的能力。在本文中,我们提出一种新颖方法,以利用 LLMs 在理解上下文外观变化方面的优势,并将该知识注入视觉模型(此处为行人检测)。尽管行人检测被视为与我们的安全直接相关(如智能驾驶系统)的关键任务之一,但由于不同场景中外观与姿态的多变性,它颇具挑战性。因此,我们提出形式化语言衍生的外观要素,并将其与行人检测中的视觉线索相结合。为此,我们建立了一个描述语料库,包含大量描述行人及其他实例各种外观的叙述。通过将它们输入 LLM,我们提取包含外观变化表示的“外观知识集”。随后,我们执行任务提示过程,以获得与下游行人检测任务相关的、受引导的代表性外观知识,即外观要素。所获得的知识要素可适配多种检测框架,从而我们能在检测器内通过将语言衍生的外观要素与视觉线索集成来提供丰富的外观信息。通过对多种行人检测器的综合实验,我们验证了方法的适配性与有效性,显示出显著的性能提升,并在两个公开行人检测基准(即 CrowdHuman 和 WiderPedestrian)上取得最先进的检测性能。

关键词

引用

@article{arxiv.2311.01025,
  title  = {Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection},
  author = {Sungjune Park and Hyunjun Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2311.01025},
  year   = {2024}
}