中文

VLM-HOI: 面向可解释人物-物体互动分析的视觉语言模型

计算机视觉与模式识别 2024-11-28 v1 人工智能

摘要

大型视觉语言模型 (VLM) 最近在桥接两种基本模态方面取得了显著进展。经过足够大数据集训练的 VLM 能对视觉和语言具有全面理解,从而执行多样化任务。为准确蒸馏此类知识,本文提出了一种新方法,显式地将 VLM 作为人物-物体互动 (HOI) 检测任务的目标函数形式 (\textbf{VLM-HOI})。具体而言,我们提出的方法利用图像-文本匹配技术对预测的 HOI 三元组相似度进行量化。我们以语言方式表示 HOI 三元组,以充分利用 VLM 的语言理解能力,这些能力比 CLIP 模型更适合由于其局部分辨和以对象为中心的特性。这种匹配得分用作对比优化的目标。据我们了解,这是首次将 VLM 的语言能力用于 HOI 检测。实验表明我们方法的有效性,在基准数据集上实现了 HOI 检测的状态最佳性能。我们认为将 VLM 集成到 HOI 检测中代表了向更先进和可解释的人物-物体互动分析取得的重要进展。

关键词

引用

@article{arxiv.2411.18038,
  title  = {VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis},
  author = {Donggoo Kang and Dasol Jeong and Hyunmin Lee and Sangwoo Park and Hasil Park and Sunkyu Kwon and Yeongjoon Kim and Joonki Paik},
  journal= {arXiv preprint arXiv:2411.18038},
  year   = {2024}
}

备注

18 pages