中文

面向多阶人类视觉运动处理的机器学习建模

计算机视觉与模式识别 2025-01-23 v1 人工智能 机器学习

摘要

我们的研究旨在开发能够学习类似人类感知视觉运动的机器。尽管近期计算机视觉领域的进展使基于深度神经网络的模型能够准确估计自然图像中的光流,但在架构和行为方面,计算机视觉模型与生物视觉系统之间仍存在显著差异。这种差异包括人类能够感知更高阶图像特征(第二阶运动)的能力,而许多计算机视觉模型无法捕获这种能力,因为它们依赖强度守恒定律。我们的模型架构模拟了生物视觉系统中 V1-MT 运动处理通路,利用可训练的运动能量传感器库和循环图网络。采用多样化自然视频进行监督学习,使模型能够复制关于第一阶(基于亮度的)运动感知的心理生理学发现。对于第二阶运动,受神经科学发现的启发,模型包含一个额外的感知通路,在运动能量感知之前进行非线性预处理,采用简单的三维 CNN 模块实现。当探讨大脑如何在自然环境中获得感知第二阶运动能力时,其中纯第二阶信号稀少,我们假设第二阶机制对于在光学波动(如光面反射高光)中估计稳健物体运动至关重要。我们在具有不同运动物体材料属性的新型运动数据集上训练了双通道模型。我们发现,针对非 Lambertian 材料的物体运动估计自然地赋予了模型感知第二阶运动的能力,正如人类一样.最终得到的模型在结构上与生物系统一致,同时对自然场景中的第一阶和第二阶运动现象具有良好的泛化能力。

关键词

引用

@article{arxiv.2501.12810,
  title  = {Machine Learning Modeling for Multi-order Human Visual Motion Processing},
  author = {Zitang Sun and Yen-Ju Chen and Yung-Hao Yang and Yuan Li and Shin'ya Nishida},
  journal= {arXiv preprint arXiv:2501.12810},
  year   = {2025}
}