腹侧-背侧神经网络:基于选择性注意的目标检测
计算机视觉与模式识别
2020-05-21 v1 机器学习
图像与视频处理
摘要
深度卷积神经网络(CNNs)已在图像分类任务中屡次被证明表现优异。然而,目标检测方法仍亟需显著改进。本文受人类视觉系统结构启发,提出一种称为腹侧-背侧网络(VDNets)的新框架。粗略而言,视觉输入信号沿两条独立的神经通路进行分析,一条位于颞叶,另一条位于顶叶。这两条通路在功能上的粗略区分在于目标识别——信号的“是什么”——与提取位置相关信息——信号的“在哪里”。从初级视觉皮层出发、进入颞叶的腹侧通路以“是什么”信息为主,而进入顶叶的背侧通路则以“在哪里”信息为主。受此结构启发,我们提出整合互补的“腹侧网络”与“背侧网络”。目标身份信息可引导定位,位置信息可引导注意至相关图像区域,从而改善目标识别。这一新型双网络框架使目标检测更为聚焦。实验结果显示,所提方法在 PASCAL VOC 2007 上以 8% (mAP)、在 PASCAL VOC 2012 上以 3% (mAP) 优于当前最优目标检测方法。此外,在 Yearbook 图像上的技术对比显示了 VDNet 显著的定性与定量优势。
引用
@article{arxiv.2005.09727,
title = {Ventral-Dorsal Neural Networks: Object Detection via Selective Attention},
author = {Mohammad K. Ebrahimpour and Jiayun Li and Yen-Yun Yu and Jackson L. Reese and Azadeh Moghtaderi and Ming-Hsuan Yang and David C. Noelle},
journal= {arXiv preprint arXiv:2005.09727},
year = {2020}
}
备注
in Proceedings of WACV. arXiv admin note: substantial text overlap with arXiv:2005.07787