基于交叉 IOU 损失的位置敏感视觉识别
计算机视觉与模式识别
2021-04-13 v1
摘要
目标检测、实例分割与姿态估计均为流行的视觉识别任务,它们需要通过内部或边界关键点来定位物体。本文将此类任务概括为位置敏感视觉识别,并提出了一种名为位置敏感网络(LSNet)的统一解决方案。以一个深度神经网络为骨干,LSNet 预测一个锚点与一组关键点,二者共同定义目标物体的形状。优化 LSNet 的关键在于拟合多种尺度的能力,为此我们设计了一种新颖的损失函数,称为交叉 IOU 损失,其计算每个锚点-关键点对的交叉 IOU 以近似预测与真值之间的全局 IOU。灵活定位且精准预测的关键点也使 LSNet 能够融合更丰富的上下文信息用于视觉识别。在 MS-COCO 数据集上的评估表明,LSNet 在无锚框目标检测(53.5% 框 AP)与实例分割(40.2% 掩码 AP)上刷新了最优精度,并在多尺度人体姿态检测中展现出良好性能。代码见 https://github.com/Duankaiwen/LSNet
引用
@article{arxiv.2104.04899,
title = {Location-Sensitive Visual Recognition with Cross-IOU Loss},
author = {Kaiwen Duan and Lingxi Xie and Honggang Qi and Song Bai and Qingming Huang and Qi Tian},
journal= {arXiv preprint arXiv:2104.04899},
year = {2021}
}
备注
13 pages, 7 figures and 5 tables