解耦预训练用于人-物交互检测
计算机视觉与模式识别
2024-04-03 v1
摘要
检测人-物交互(HOI)长期以来受到可用监督数据量的限制。最近的方法通过根据伪标签进行预训练来解决这个问题,这些伪标签将对象区域与从图像标题解析出的HOI三元组对齐。然而,伪标签是棘手且嘈杂的,使得HOI预训练成为一个复杂的过程。因此,我们提出了一种高效的解耦预训练方法用于HOI检测(DP-HOI)来解决这个问题。首先,DP-HOI利用目标检测和动作识别数据集分别预训练检测和解码器层。然后,我们安排这些解码器层,使得预训练架构与下游HOI检测任务一致。这促进了有效的知识迁移。具体地,检测解码器在每个动作识别数据集图像中识别可靠的人类实例,生成一个对应的查询,并将其输入交互解码器进行动词分类。接下来,我们结合同一图像中的人类实例动词预测,并施加图像级监督。DP-HOI结构可以轻松适应HOI检测任务,实现有效的模型参数初始化。因此,它显著提升了现有HOI检测模型在广泛稀有类别上的性能。代码和预训练权重可在 https://github.com/xingaoli/DP-HOI 获取。
引用
@article{arxiv.2404.01725,
title = {Disentangled Pre-training for Human-Object Interaction Detection},
author = {Zhuolong Li and Xingao Li and Changxing Ding and Xiangmin Xu},
journal= {arXiv preprint arXiv:2404.01725},
year = {2024}
}
备注
Accepted by CVPR2024