RLIP:用于人-物交互检测的关系语言-图像预训练
计算机视觉与模式识别
2022-11-17 v3
摘要
人-物交互(Human-Object Interaction, HOI)检测任务旨在对人类与其环境交互的细粒度视觉解析,支持广泛应用。先前工作已证明有效架构设计及相关线索集成对更准确HOI检测的益处。然而,针对该任务的恰当预训练策略设计仍未被现有方法充分探索。为弥补此缺口,我们提出关系语言-图像预训练(Relational Language-Image Pre-training, RLIP),一种利用实体与关系描述进行对比预训练的策略。为有效利用此类预训练,我们作出三点技术贡献:(1)一种新的并行实体检测与时序关系推断(Parallel entity detection and Sequential relation inference, ParSe)架构,可在整体优化预训练中使用实体与关系描述;(2)一个合成数据生成框架Label Sequence Extension,扩展每个minibatch内可用语言数据规模;(3)处理歧义的机制Relation Quality Labels与Relation Pseudo-Labels,以减轻预训练数据中歧义/噪声样本的影响。通过大量实验,我们证明了这些统称为RLIP-ParSe的贡献对改进零样本、少样本和微调HOI检测性能以及增强从噪声标注学习的鲁棒性的益处。代码将发布于https://github.com/JacobYuan7/RLIP。
引用
@article{arxiv.2209.01814,
title = {RLIP: Relational Language-Image Pre-training for Human-Object Interaction Detection},
author = {Hangjie Yuan and Jianwen Jiang and Samuel Albanie and Tao Feng and Ziyuan Huang and Dong Ni and Mingqian Tang},
journal= {arXiv preprint arXiv:2209.01814},
year = {2022}
}
备注
Accepted to NeurIPS 2022 as a Spotlight paper