在人机交互检测中探索谓词视觉上下文
计算机视觉与模式识别
2023-11-09 v2 人工智能
机器学习
摘要
近来,DETR框架已成为人机交互(HOI)研究的主流方法。特别地,两阶段基于transformer的HOI检测器是性能最佳且训练高效的方法之一。然而,这些方法常将HOI分类建立在缺乏细粒度上下文信息的物体特征上,偏重物体身份与边界框端点的视觉线索而忽略姿态与朝向信息。这自然阻碍了复杂或模糊交互的识别。在这项工作中,我们通过可视化与精心设计的实验研究这些问题。相应地,我们探究如何通过交叉注意力最优地重新引入图像特征。借助改进的查询设计、对键与值的广泛探索,以及作为空间引导的框对位置嵌入,我们具有增强谓词视觉上下文(PViC)的模型在HICO-DET与V-COCO基准上优于最先进方法,同时保持较低的训练成本。
引用
@article{arxiv.2308.06202,
title = {Exploring Predicate Visual Context in Detecting Human-Object Interactions},
author = {Frederic Z. Zhang and Yuhui Yuan and Dylan Campbell and Zhuoyao Zhong and Stephen Gould},
journal= {arXiv preprint arXiv:2308.06202},
year = {2023}
}
备注
Accepted to ICCV 2023