PhiNet v2:基于视频的无掩码脑类比视觉基础模型
计算机视觉与模式识别
2025-05-19 v1 人工智能
机器学习
摘要
近期自监督学习(SSL)的进展通过创新的架构和学习目标推动了计算机视觉的革命,但尚未充分利用生物视觉处理系统的洞见。最近提出了基于ResNet主干网络并 operates on static图像输入的脑类比SSL模型PhiNet。本文引入PhiNet v2,一种基于Transformer的新型架构,处理时间序列视觉输入(即图像序列),无需依赖强数据增强。我们的模型利用变分推断从连续输入流中学习稳健的视觉表征,类似于人类视觉处理。通过大量实验,我们展示PhiNet v2在竞争性能上与最先进的视觉基础模型相当,同时保持了从顺序输入中学习且不依赖强数据增强的能力。这一工作代表了更符合人类认知过程的计算机视觉系统的重要一步。
关键词
引用
@article{arxiv.2505.11129,
title = {PhiNet v2: A Mask-Free Brain-Inspired Vision Foundation Model from Video},
author = {Makoto Yamada and Kian Ming A. Chai and Ayoub Rhim and Satoki Ishikawa and Mohammad Sabokrou and Yao-Hung Hubert Tsai},
journal= {arXiv preprint arXiv:2505.11129},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2405.14650