基于多模态提示的开放世界人-物交互检测
计算机视觉与模式识别
2024-06-12 v1
摘要
在本文中,我们开发了 \textbf{MP-HOI},一个强大的基于多模态提示的 HOI 检测器,旨在利用文本描述进行开放集泛化,并利用视觉示例处理描述中的高歧义性,从而在开放世界中实现 HOI 检测。具体来说,它将视觉提示集成到现有的仅由语言引导的 HOI 检测器中,以处理文本描述在泛化中遇到困难的情况,并应对具有高交互歧义的复杂场景。为了促进 MP-HOI 的训练,我们构建了一个名为 Magic-HOI 的大规模 HOI 数据集,该数据集将六个现有数据集整合到一个统一的标签空间中,形成了超过 186K 张图像,包含 2.4K 个物体、1.2K 个动作和 20K 个 HOI 交互。此外,为了解决 Magic-HOI 数据集中的长尾问题,我们引入了一个自动生成真实标注 HOI 图像的流程,并提出了 SynHOI,一个包含 100K 张图像的高质量合成 HOI 数据集。利用这两个数据集,MP-HOI 通过统一的对比损失将 HOI 任务优化为多模态提示与物体/交互之间的相似性学习过程,从而从大规模数据中学习可泛化和可迁移的物体/交互表示。MP-HOI 可以作为一个通用 HOI 检测器,其 HOI 词汇量超过现有专家模型的 30 倍以上。同时,我们的结果表明,MP-HOI 在现实场景中表现出卓越的零样本能力,并在各种基准测试中持续取得新的最先进性能。
引用
@article{arxiv.2406.07221,
title = {Open-World Human-Object Interaction Detection via Multi-modal Prompts},
author = {Jie Yang and Bingliang Li and Ailing Zeng and Lei Zhang and Ruimao Zhang},
journal= {arXiv preprint arXiv:2406.07221},
year = {2024}
}
备注
CVPR24. arXiv admin note: text overlap with arXiv:2305.12252