中文

将动态视觉场景的神经编码与基础视觉模型对齐

计算机视觉与模式识别 2024-07-16 v1 人工智能

摘要

我们的大脑以高度动态的方式表示不断变化的环境中神经元的活动。视觉像素在动态自然场景中的时序特征被嵌入视网膜神经元的响应中。建立视觉像素与神经响应之间的内在时序关系至关重要。最近的基础视觉模型为理解图像像素提供了一种先进的方式。然而,神经编码的神经生理学理解仍缺乏对其与像素对齐的深入认识。大多数先前研究使用静态图像或源自静态图像的人工视频来模拟更真实且复杂的刺激物。尽管这些简单情景有效帮助分离影响视觉编码的关键因素,但复杂的时序关系却未得到考虑。为分解自然场景中视觉编码的时序特征,本文提出Vi-ST(spatiotemporal convolutional neural network),该模型以自监督 Vision Transformer(ViT)先验为输入,旨揭示视网膜神经元群的时序编码模式。该模型在概括测试中表现出稳健的预测性能。此外,通过详细的消融实验,我们展示了每个时序模块的重要性。我们还引入一种视觉编码评估指标,纳入时序考虑,比较不同神经元数量对互补编码的影响。综上所述,我们提出的Vi-ST展示了大脑动态视觉场景神经编码的一种新建模框架,有效地将大脑对视频的表征与神经活动对齐。代码已公开于 https://github.com/wurining/Vi-ST。

关键词

引用

@article{arxiv.2407.10737,
  title  = {Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models},
  author = {Rining Wu and Feixiang Zhou and Ziwei Yin and Jian K. Liu},
  journal= {arXiv preprint arXiv:2407.10737},
  year   = {2024}
}

备注

This article is accepted by ECCV 2024, which ID is 12149. Accepted papers' id can be found in: https://eccv2024.ecva.net/Conferences/2024/AcceptedPapers