面向视觉识别的深度注意力结构化表示学习
计算机视觉与模式识别
2018-05-16 v1
摘要
结构化表示(如词袋、VLAD 和 Fisher 向量)已被证明对处理复杂的视觉识别任务极为有效。因此,它们最近被整合进深度架构中。然而,尽管有效,由此产生的深度结构化表示学习策略通常聚合整幅图像的局部特征,忽略了在复杂识别任务中某些区域比其它区域提供更强判别性信息这一事实。本文引入一种注意力结构化表示学习框架,在聚合过程中融入图像特定的注意力机制。我们的框架以端到端方式联合预测图像类别标签与注意力图,且除目标标签外无需任何其他监督。如我们的实验所证明,该方法始终优于无注意力的结构化表示学习,并在标准场景识别与细粒度分类基准上取得最先进结果。
引用
@article{arxiv.1805.05389,
title = {Deep Attentional Structured Representation Learning for Visual Recognition},
author = {Krishna Kanth Nakka and Mathieu Salzmann},
journal= {arXiv preprint arXiv:1805.05389},
year = {2018}
}