基于注意力的金字塔聚合网络用于视觉地点识别
计算机视觉与模式识别
2018-08-02 v1
摘要
视觉地点识别在城市环境中具有挑战性,通常被视为大规模图像检索任务。地点识别的内在挑战在于:汽车和树木等易混淆物体频繁出现于复杂城市场景中,且具有重复结构的建筑可能导致过度计数与突发性问题,从而劣化图像表示。为解决这些问题,我们提出一种基于注意力的金字塔聚合网络(APANet),其以端到端方式训练用于地点识别。APANet 的主要组件之一空间金字塔池化能有效编码包含地理信息的多尺度建筑。另一组件注意力块用作区域评估器,以抑制易混淆区域特征同时突出判别性特征。在测试时,我们进一步提出一种简单而有效的 PCA 幂白化策略,其通过合理限制过度计数的影响显著改进了广泛使用的 PCA 白化。实验评估表明,所提 APANet 在两个地点识别基准上优于最先进方法,并在标准图像检索数据集上泛化良好。
引用
@article{arxiv.1808.00288,
title = {Attention-based Pyramid Aggregation Network for Visual Place Recognition},
author = {Yingying Zhu and Jiong Wang and Lingxi Xie and Liang Zheng},
journal= {arXiv preprint arXiv:1808.00288},
year = {2018}
}
备注
Accepted to ACM Multimedia 2018