中文

局部感知的零样本人-物交互检测

计算机视觉与模式识别 2025-05-27 v1

摘要

近期的零样本人-物交互(HOI)检测方法通常利用大型视觉-语言模型(VLM),即 CLIP,在未见类别上的泛化能力,在各种零样本设置下展现出令人印象深刻的结果。然而,现有方法难以将 CLIP 表示适配于人-物对,因为 CLIP 往往会忽略区分交互所需的细粒度信息。为了解决这个问题,我们设计了 LAIN,一种增强 CLIP 表示的局部性和交互感知能力的新型零样本 HOI 检测框架。局部感知涉及捕获单个对象的细粒度细节和空间结构,这是通过聚合相邻邻域块的信息和空间先验来实现的。交互感知涉及识别人类是否以及如何与对象进行交互,这是通过捕获人与对象之间的交互模式来实现的。通过将局部性和交互感知注入 CLIP 表示,LAIN 捕获了有关人-物对的详细信息。我们在现有基准上的广泛实验表明,LAIN 在各种零样本设置下均优于先前的方法,证明了局部性和交互感知对于有效的零样本 HOI 检测的重要性。

关键词

引用

@article{arxiv.2505.19503,
  title  = {Locality-Aware Zero-Shot Human-Object Interaction Detection},
  author = {Sanghyun Kim and Deunsol Jung and Minsu Cho},
  journal= {arXiv preprint arXiv:2505.19503},
  year   = {2025}
}

备注

Accepted to CVPR2025; Code is available at: https://github.com/OreoChocolate/LAIN