中文

基于 Transformer 的组合式学习在人体-物体交互检测中的应用

计算机视觉与模式识别 2023-08-14 v1

摘要

人体-物体交互(HOI)检测是理解人类活动和视觉场景的重要部分。标注实例的长尾分布是 HOI 检测中的主要挑战,推动了少样本和零样本学习的研究。受 HOI 三元组组合本质的启发,一些现有方法采用组合式学习的思路,即单独学习物体和动作特征,并将其重新组合作为新的训练样本。然而,这些方法遵循基于 CNN 的两阶段范式,特征提取能力有限,且常依赖辅助信息以获得更好性能。在不引入任何额外信息的情况下,我们创造性地提出了一种基于 Transformer 的组合式 HOI 学习框架。人体-物体对表征和交互表征在不同 HOI 实例间重新组合,融入了更丰富的上下文信息并促进了知识泛化。实验表明,我们这种简单而有效的方法达到了最先进的性能,尤其在罕见 HOI 类别上。

关键词

引用

@article{arxiv.2308.05961,
  title  = {Compositional Learning in Transformer-Based Human-Object Interaction Detection},
  author = {Zikun Zhuang and Ruihao Qian and Chi Xie and Shuang Liang},
  journal= {arXiv preprint arXiv:2308.05961},
  year   = {2023}
}