利用 Foveated Event Vision 实现低光环境下的文字识别
计算机视觉与模式识别
2025-06-10 v1 机器人学
摘要
当前配备 RGB 相机的智能眼镜在低光环境和高速运动场景中因运动模糊和帧相机的有限动态范围而难以感知环境。此外,使用帧相机捕获密集图像需要较大的带宽和功耗,进而快速耗尽电池。这些挑战在开发能够从图像中读取文字的算法方面尤为重要。本文提出一种新的基于事件的光学字符识别 (Optical Character Recognition, OCR) 方法,用于智能眼镜。通过利用用户的眼球注视位置,对事件流进行 foveation,可将带宽显著降低约 98%,同时发挥事件相机在高动态范围和快速场景中的优势。我们的方法采用在合成数据上训练的深度二值重建,并利用多模态大语言模型 (multimodal LLMs) 实现 OCR,超越传统 OCR 解决方案。我们的结果表明,在 RGB 相机难以工作的低光环境中读取文字,同时使用最多 2400 倍于可穿戴 RGB 相机的带宽。
引用
@article{arxiv.2506.06918,
title = {Reading in the Dark with Foveated Event Vision},
author = {Carl Brander and Giovanni Cioffi and Nico Messikommer and Davide Scaramuzza},
journal= {arXiv preprint arXiv:2506.06918},
year = {2025}
}
备注
CVPR 2025 Workshop on Event-based Vision