用于人-物交互检测的视觉组合学习
计算机视觉与模式识别
2020-10-06 v2
摘要
人-物交互(HOI)检测旨在定位并推断图像中人与物体之间的关系。由于物体和动词类型的可能组合数量巨大,形成长尾分布,因此该任务极具挑战性。我们设计了一个深度视觉组合学习(VCL)框架,这是一个简单而高效的框架,能有效解决此问题。VCL 首先将 HOI 表示分解为物体和动词的特定特征,然后通过在特征空间中拼接这些分解后的特征来组合新的交互样本。分解与组合的集成使 VCL 能够在不同的 HOI 样本和图像之间共享物体和动词特征,并生成新的交互样本和新的 HOI 类型,从而在很大程度上缓解了长尾分布问题,并有利于小样本或零样本 HOI 检测。大量实验表明,所提出的 VCL 能有效提升在 HICO-DET 和 V-COCO 上的 HOI 检测泛化能力,并在 HICO-DET 上优于近期最先进的方法。代码可在 https://github.com/zhihou7/VCL 获取。
引用
@article{arxiv.2007.12407,
title = {Visual Compositional Learning for Human-Object Interaction Detection},
author = {Zhi Hou and Xiaojiang Peng and Yu Qiao and Dacheng Tao},
journal= {arXiv preprint arXiv:2007.12407},
year = {2020}
}
备注
Accepted in ECCV2020