何处着眼:一种基于强化学习的统一视觉识别注意力模型
计算机视觉与模式识别
2021-11-16 v1
摘要
利用循环神经网络实现视觉注意力的思想在计算机视觉界已颇受欢迎。尽管循环注意力模型(RAM)利用更大块尺寸的局部观测以扩大其感知范围,但可能导致高方差与不稳定。例如,我们需要高方差的高斯策略在大幅图像中探索感兴趣目标,这可能引发随机搜索与不稳定学习。本文提出将自顶向下与自底向上注意力统一用于循环视觉注意力。我们的模型利用图像金字塔与 Q-learning 在自顶向下注意力机制中选择感兴趣区域,进而引导自底向上方法中的策略搜索。此外,我们在自底向上循环神经网络上增加另两个约束以改进探索。我们在端到端强化学习框架中训练模型,并在视觉分类任务上评估方法。实验结果在视觉分类任务上优于卷积神经网络(CNNs)基线与自底向上循环注意力模型。
引用
@article{arxiv.2111.07169,
title = {Where to Look: A Unified Attention Model for Visual Recognition with Reinforcement Learning},
author = {Gang Chen},
journal= {arXiv preprint arXiv:2111.07169},
year = {2021}
}
备注
11 pages