用于人-物交互检测的凝聚式 Transformer
计算机视觉与模式识别
2023-08-17 v1 人工智能
摘要
我们提出一种凝聚式 Transformer(AGER),首次使基于 Transformer 的人-物交互(HOI)检测器能够以单阶段、端到端的方式灵活利用额外的实例级线索。AGER 通过动态聚类图像块 token 并在文本引导下将聚类中心对齐到实例来获取实例 token,从而具有两个优势:1)完整性:每个实例 token 被鼓励包含某个实例的所有判别性特征区域,这在提取不同实例级线索方面表现出显著改进,并随后在 HICO-Det 上以 36.75 mAP 取得了 HOI 检测的新最优性能。2)高效性:动态聚类机制使 AGER 能够与 Transformer 编码器的特征学习联合生成实例 token,消除了先前方法中额外目标检测器或实例解码器的需要,从而允许在单阶段、端到端流程中提取用于 HOI 检测的可取额外线索。具体而言,即使与不含额外线索提取的普通类 DETR 流程相比,AGER 也将 GFLOPs 降低了 8.5%,并将 FPS 提高了 36%。
引用
@article{arxiv.2308.08370,
title = {Agglomerative Transformer for Human-Object Interaction Detection},
author = {Danyang Tu and Wei Sun and Guangtao Zhai and Wei Shen},
journal= {arXiv preprint arXiv:2308.08370},
year = {2023}
}
备注
Accepted by ICCV'23