中文

用于视觉识别的规划识别驱动注意力建模

计算机视觉与模式识别 2021-10-15 v2 人工智能

摘要

人类对外在活动或外部主体的视觉识别涉及高层规划识别与低层感知之间的相互作用。鉴于此,一个自然的问题是:低层感知能否通过高层规划识别得以改进?我们形式化了利用已识别规划生成更好的自顶向下注意力图 \cite{gazzaniga2009,baluch2011} 以提升感知性能的问题。我们将这些自顶向下注意力图特别地称为规划识别驱动注意力图。为解决该问题,我们引入像素动态网络(Pixel Dynamics Network)。像素动态网络作为一种观测模型,在给定像素观测与像素级动作特征的情况下,预测每个像素位置上目标点的下一状态。这类似于在内部学习一个像素级动态模型。像素动态网络是一种卷积神经网络(ConvNet),具有专门设计的架构。因此,像素动态网络可借助 ConvNets 的并行计算优势,同时学习像素级动态模型。我们进一步证明了像素动态网络作为观测模型与部分可观测马尔可夫决策过程(POMDP)框架中信念更新之间的等价性。我们在事件识别任务中评估了我们的像素动态网络。我们构建了一个事件识别系统 ER-PRN,它以像素动态网络为子例程,基于由规划识别驱动注意力增强的观测来识别事件。

关键词

引用

@article{arxiv.1812.00301,
  title  = {Plan-Recognition-Driven Attention Modeling for Visual Recognition},
  author = {Yantian Zha and Yikang Li and Tianshu Yu and Subbarao Kambhampati and Baoxin Li},
  journal= {arXiv preprint arXiv:1812.00301},
  year   = {2021}
}