基于视觉注视力的视网膜人工智能模拟
计算机视觉与模式识别
2026-02-23 v2 神经与进化计算
摘要
本研究提出一种受视觉注视力驱动的视网膜人工智能模拟框架,灵感来源于扫视机制,并通过在分类任务中的端到端优化来评估性能提升。利用视觉变换器的自注意力图预测输入图像中的显著性 patches,以模拟视觉注视。随后,这些 patches 被编码为可训练的 U-Net,并使用 pulse2percept 框架进行模拟,以预测视觉感知。通过引入可学习的编码器,我们旨在优化传递至视网膜植入物的视觉信息,从而解决电极阵列的分辨率受限问题以及输入刺激与结果光斑之间的扭曲问题。对预测的感知进行评估时,使用自监督的 DINOv2 基础模型进行评估,可选用可学习的线性层以提高分类准确率。在 ImageNet 验证集的子集上,基于注视力的框架实现了 87.72% 的分类准确率,使用基于真实受试者生理数据的计算参数,显著优于基于下采样的 40.59% 准确率,并接近健康上限的 92.76%。我们的ethods 显示了在视网膜人工智能有限分辨率下,产生更具语义可理解性的感知的潜力。
引用
@article{arxiv.2410.11688,
title = {Visual Fixation-Based Retinal Prosthetic Simulation},
author = {Yuli Wu and Do Dinh Tan Nguyen and Henning Konermann and Rüveyda Yilmaz and Peter Walter and Johannes Stegmaier},
journal= {arXiv preprint arXiv:2410.11688},
year = {2026}
}