VLPD:基于视觉-语言语义自监督的上下文感知行人检测
计算机视觉与模式识别
2023-04-07 v1 人工智能
多媒体
摘要
在城市场景中准确检测行人对自动驾驶或视频监控等实际应用具有重要意义。然而,易混淆的类人物体常导致错误检测,而小尺度或严重遮挡的行人因其异常外观容易被漏检。为应对这些挑战,仅依靠物体区域是不够的,因此如何充分利用更明确且语义化的上下文成为关键问题。同时,以往的上下文感知行人检测器要么仅利用视觉线索学习潜在上下文,要么需要费力标注以获取明确且语义化的上下文。因此,本文提出一种通过视觉-语言语义自监督实现上下文感知行人检测(VLPD)的新方法,以在无任何额外标注的情况下建模显式语义上下文。首先,我们提出一种自监督视觉-语言语义(VLS)分割方法,通过视觉-语言模型自生成的语义类别显式标签,同时学习全监督行人检测与上下文分割。此外,基于 VLS 获得的更明确且语义化的上下文,提出一种自监督原型语义对比(PSC)学习方法,以更好区分行人与其他类别。在流行基准上的大量实验表明,我们所提 VLPD 优于以往 SOTA 方法,尤其在小型尺度和重度遮挡等挑战性情形下。代码见 https://github.com/lmy98129/VLPD。
引用
@article{arxiv.2304.03135,
title = {VLPD: Context-Aware Pedestrian Detection via Vision-Language Semantic Self-Supervision},
author = {Mengyin Liu and Jie Jiang and Chao Zhu and Xu-Cheng Yin},
journal= {arXiv preprint arXiv:2304.03135},
year = {2023}
}
备注
Accepted by CVPR 2023