用于鲁棒人-物交互检测的词语多义解析网络
计算机视觉与模式识别
2021-03-25 v3
摘要
人-物交互(HOI)检测对于以人为中心的场景理解任务十分重要。现有工作往往假设同一动词在不同HOI类别中具有相似的视觉特征,这种做法忽略了该动词多样的语义含义。为解决此问题,本文提出一种新颖的词语多义解析网络(PD-Net),以三种不同方式解析动词的视觉多义性用于HOI检测。首先,我们通过两个新颖模块——语言先验引导的通道注意力(LPCA)与基于语言先验的特征增强(LPFA)——将HOI检测特征精炼为具有多义感知能力。LPCA为每个待识别HOI类别突出人与物体外观特征中的重要元素;此外,LPFA利用语言先验增强用于HOI检测的人体姿态与空间特征,使动词分类器获得语言提示,从而降低同一动词的类内差异。其次,我们引入一种新颖的多义感知模态融合模块(PAMF),其引导PD-Net依据语言先验判定更为重要的特征类型做出决策。第三,我们提出通过为语义相似的HOI类别共享动词分类器来缓解动词多义问题。此外,为推进动词多义问题研究,我们构建了一个名为HOI-VerbPolysemy(HOIVP)的新基准数据集,其包含现实世界中具有多样语义含义的常用动词(谓词)。最后,通过解析动词的视觉多义性,我们的方法在HICO-DET、V-COCO与HOI-VP数据库上以显著优势超越最先进方法。本文代码与数据见 https://github.com/MuchHair/PD-Net。
引用
@article{arxiv.2008.02918,
title = {Polysemy Deciphering Network for Robust Human-Object Interaction Detection},
author = {Xubin Zhong and Changxing Ding and Xian Qu and Dacheng Tao},
journal= {arXiv preprint arXiv:2008.02918},
year = {2021}
}
备注
The IJCV version extended significantly from our ECCV2020 conference paper