中文

基于网格细胞路径整合的运动驱动视觉对象识别

人工智能 2021-02-19 v1

摘要

网格细胞使大脑能够通过路径整合(利用自身运动信息更新自身位置)有效建模世界的物理空间并导航。近期提议表明,大脑可能使用类似机制来理解包括视觉在内的多种感官模态中对象的结构。在机器视觉中,给定图像感官采样序列(如眼跳)的对象识别,当序列不遵循一致固定模式时是一个具挑战性的问题——然而这是人类自然且轻松完成的事。我们探究皮层网络中基于网格细胞的路径整合如何支持在任意输入序列下可靠识别对象。我们的网络(GridCellNet)利用网格细胞计算整合视觉信息并基于运动进行预测。我们使用局部 Hebbian 可塑性规则从少量样本快速学习(少样本学习),并考量仅给定图像特征块序列识别 MNIST 数字的任务。我们将 GridCellNet 与 k-近邻(k-NN)分类器及循环神经网络(RNNs)比较,后两者缺乏处理任意输入样本序列的显式机制。我们展示 GridCellNet 能可靠分类,泛化至未见样本与全新序列轨迹。我们进一步展示常在采样输入空间的一部分后即推断成功,使预测性 GridCellNet 仅凭少许运动即可重建图像其余部分。我们提议,具主动传感器的动态运动智能体可利用网格细胞表征不仅用于导航,也用于所见对象的高效识别与特征预测。

关键词

引用

@article{arxiv.2102.09076,
  title  = {Grid Cell Path Integration For Movement-Based Visual Object Recognition},
  author = {Niels Leadholm and Marcus Lewis and Subutai Ahmad},
  journal= {arXiv preprint arXiv:2102.09076},
  year   = {2021}
}

备注

15 pages, 6 figures