中文

基于双流式视觉定位的主动视觉学习

计算机视觉与模式识别 2024-04-23 v3 人工智能

摘要

深度神经网络(DNN)基于机器感知框架在一次性处理整个输入后,提供关于“正在观察什么对象”和“它位于何处”的答案。相比之下,神经科学中的“双流假设”将人类视觉皮层的神经处理解释为一种主动视觉系统,它利用大脑的两个独立区域分别回答“是什么”和“何处”的问题。本文提出了受“双流假设”启发的机器学习框架,并探讨了其所带来的潜在益处。具体而言,所提出的框架建模了以下机制:1)关注眼部 fovea 部分所感知的输入区域的 ventral(“是什么”)流;2)提供视觉引导的 dorsal(“何处”)流;3)迭代处理两个流以校准视觉焦点并处理所聚焦图像块的序列。所提出的框架的训练通过为 ventral 流模型进行基于标签的 DNN 训练,以及为 dorsal 流模型进行强化学习来实现。我们表明,双流式 foveation 基于学习的框架可应用于挑战性的弱监督对象定位(WSOL)任务,即训练数据仅包含对象类别或其属性。该框架能够预测对象的属性,并成功地通过预测其边界框来定位对象。我们还指出,由于两个流的独立性,dorsal 模型可以独立应用于未见过的图像,以定位来自不同数据集的对象。

关键词

引用

@article{arxiv.2403.15977,
  title  = {Towards Two-Stream Foveation-based Active Vision Learning},
  author = {Timur Ibrayev and Amitangshu Mukherjee and Sai Aparna Aketi and Kaushik Roy},
  journal= {arXiv preprint arXiv:2403.15977},
  year   = {2024}
}

备注

Accepted version of the article, 18 pages, 14 figures