中文

面向视觉大语言模型的跨层级人物-物体交互蒸馏 CL-HOI

计算机视觉与模式识别 2024-10-22 v1 计算与语言

摘要

人物-物体交互(HOI)检测领域近期受到视觉语言模型(VLM)的推动,但这些方法常依赖大量手动标注。视觉大语言模型(VLLM)能够从图像层面内在地识别和推理交互,但计算负担沉重且未针对实例级 HOI 检测进行设计。为克服这些限制,我们提出了跨层级 HOI 蒸馏(CL-HOI)框架,通过无需手动标注地从 VLLM 的图像级理解中蒸馏实例级 HOI。我们的方法包含两个阶段:上下文蒸馏阶段,利用视觉语言翻译器(VLT)将视觉信息转化为语言形式;交互蒸馏阶段,由交互认知网络(ICN)推理空间、视觉和上下文关系。我们设计对比蒸馏损失,将教师模型的图像级上下文和交互知识传递给学生模型,实现实例级 HOI 检测。在 HICO-DET 和 V-COCO 数据集上的评估表明,CL-HOI 超越了现有弱监督方法和 VLLM 监督方法,证明了无需手动标注即可检测 HOI 的有效性。

关键词

引用

@article{arxiv.2410.15657,
  title  = {CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models},
  author = {Jianjun Gao and Chen Cai and Ruoyu Wang and Wenyang Liu and Kim-Hui Yap and Kratika Garg and Boon-Siew Han},
  journal= {arXiv preprint arXiv:2410.15657},
  year   = {2024}
}