中文

基于弱监督的人-物交互检测

计算机视觉与模式识别 2021-12-02 v1

摘要

本文的目标是人与物体交互(HO-I)检测。HO-I检测旨在从图像中找出交互的人-物区域并分类其交互类别。近年来研究者借助来自[5]的强HO-I对齐监督取得了显著进展。HO-I对齐监督将人与其交互物体配对,并将人-物对与其交互类别对齐。由于收集此类标注代价高昂,本文提出在无对齐监督下进行HO-I检测。我们转而依赖图像级监督,仅枚举图像中存在的交互而不指出其发生位置。本文有三方面贡献:i) 提出Align-Former,一种基于视觉transformer的CNN,仅用图像级监督即可检测HO-I。ii) Align-Former配备HO-I对齐层,可学习选择合适的目标以实现检测器监督。iii) 在HICO-DET [5]和V-COCO [13]上评估Align-Former,表明Align-Former大幅优于现有图像级监督HO-I检测器(在HICO-DET [5]上mAP从16.14%提升至20.85%,提高4.71%)。

关键词

引用

@article{arxiv.2112.00492,
  title  = {Human-Object Interaction Detection via Weak Supervision},
  author = {Mert Kilickaya and Arnold Smeulders},
  journal= {arXiv preprint arXiv:2112.00492},
  year   = {2021}
}

备注

Accepted at BMVC'21