利用运动估计实现Bayer域高效计算机视觉
计算机视觉与模式识别
2025-08-15 v2 图像与视频处理
摘要
现有的计算机视觉处理管道使用图像传感器获取视觉信息,图像传感器以Bayer模式捕获像素信息。原始传感器数据随后使用图像信号处理器 (ISP),首先按像素逐个基准将Bayer像素数据转换为RGB,随后进行基于帧的视频卷积网络 (VCN) 处理。ISP和VCN计算密集,功耗和延迟都很高。本文提出了一种新框架,消除ISP,利用运动估计直接在Bayer域加速视频视觉任务。我们引入基于运动估计的视频卷积 (MEVC),将滑动窗口运动估计集成到每个卷积层中,实现预测和残差基准的细化,以减少跨帧的冗余计算。该设计桥接了基于块的运动估计与空间卷积之间的结构差异,实现准确且低成本的处理。我们的端到端管道支持原始Bayer输入,在视频语义分割、深度估计和目标检测基准测试中实现超过70%的FLOPs减少,同时保持最小的精度下降,适用于合成Bayer转换和真实Bayer视频数据集。该框架可推广到基于卷积的模型,标志着首次有效地利用运动估计从原始传感器数据直接加速视频计算机视觉。
引用
@article{arxiv.2501.15119,
title = {Leveraging Motion Estimation for Efficient Bayer-Domain Computer Vision},
author = {Haichao Wang and Xinyue Xi and Jiangtao Wen and Yuxing Han},
journal= {arXiv preprint arXiv:2501.15119},
year = {2025}
}