面向大规模目标检测的混合知识路由模块
计算机视觉与模式识别
2018-10-31 v1
摘要
主流目标检测方法将每个区域的识别分开处理,忽视了同一场景中物体间关键的语义关联。该范式在面临严重的长尾问题时导致性能大幅下降,其中稀有类样本极少且存在大量易混淆类别。我们利用多样的人类常识知识,对大规模物体类别进行推理并达成单幅图像内的语义连贯。特别地,我们提出混合知识路由模块(HKRM),其融合了由两类知识形式路由的推理:一个用于结构化约束的显式知识模块,这些约束由关于概念的语言学知识(如共享属性、关系)总结而得;以及一个刻画某些隐式约束(如常见空间布局)的隐式知识模块。通过在区域到区域图上运作,两个模块均可被个体化并适配于与每幅图像中的视觉模式相协调,由特定知识形式引导。HKRM 轻量、通用且可通过轻松引入多种知识扩展,赋予任意检测网络全局语义推理能力。在大规模目标检测基准上的实验显示,HKRM 在 VisualGenome(1000 类)上取得约 34.5% 的 mAP 提升,在 ADE 上取得 30.4% 的提升。代码与训练模型见 https://github.com/chanyn/HKRM。
引用
@article{arxiv.1810.12681,
title = {Hybrid Knowledge Routed Modules for Large-scale Object Detection},
author = {Chenhan Jiang and Hang Xu and Xiangdan Liang and Liang Lin},
journal= {arXiv preprint arXiv:1810.12681},
year = {2018}
}
备注
9 pages, 5 figures