中文

面向零样本人物-物体交互检测的视觉多样性与区域感知提示学习

计算机视觉与模式识别 2025-10-30 v1

摘要

零样本人物-物体交互检测旨在图像中定位人物与物体,并识别其交互,即使在训练期间未见特定动词-物体对。近期研究表明,利用如 CLIP 等预训练视觉语言模型通过提示学习实现前沿成果,这些模型在共享嵌入空间中对齐自然语言提示与视觉特征。然而,现有方法仍难以处理交互的视觉复杂性,包括 (1) 同类视觉多样性——相同动词在多样姿态与情境中呈现差异,以及 (2) 跨类视觉纠缠——不同动词产生相似的视觉模式。为此,我们提出 VDRP (Visual Diversity and Region-aware Prompt learning) 框架。首先,我们引入视觉多样性感知提示学习策略,将 group-wise 视觉方差注入上下文嵌入。进一步应用高斯扰动鼓励提示捕获动词的多样视觉变化。其次,我们检索人物、物体及联合区域的 region-specific 概念,这些概念用于增强多样性感知嵌入,生成 region-aware 提示以提升动词层次区分度。在 HICO-DET 基准测试上的实验表明,我们的方法在四种零样本评估设置下实现了当前最先进性能,有效解决了同类多样性与跨类视觉纠缠问题。代码已提供于 https://github.com/mlvlab/VDRP。

关键词

引用

@article{arxiv.2510.25094,
  title  = {Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection},
  author = {Chanhyeong Yang and Taehoon Song and Jihwan Park and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2510.25094},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025