中文

基于选择性时空视觉转换器的模运算视频恢复

计算机视觉与模式识别 2025-11-12 v1 人工智能 图像与视频处理

摘要

传统图像传感器动态范围有限,在高动态范围(HDR)场景中会导致饱和。模运算相机通过将入射辐射折叠到受限范围内来解决此问题,但需要专门的解包算法来重建原始信号。与HDR恢复不同,后者是从常规采样扩展动态范围,而模运算恢复则从折叠样本中恢复实际值。尽管模运算图像恢复技术已有十余年的历史,但在运用现代深度学习技术方面的进展仍缓慢。本文证明,标准HDR方法不适用于模运算恢复。然而,Transformer能够捕获全局依赖关系和空间-时间关系,这对于解决折叠视频帧至关重要。然而,为模运算恢复调整现有Transformer架构需要新技术。为此,我们提出了选择性时空视觉转换器(Selective Spatiotemporal Vision Transformer, SSViT),这是第一个用于模运算视频重建的深度学习框架。SSViT采用令牌选择策略以提高效率并聚焦于最关键的区域。实验表明,SSViT能够从8位折叠视频中生成高质量的重建,并在模运算视频恢复任务中实现最先进的性能。

关键词

引用

@article{arxiv.2511.07479,
  title  = {Modulo Video Recovery via Selective Spatiotemporal Vision Transformer},
  author = {Tianyu Geng and Feng Ji and Wee Peng Tay},
  journal= {arXiv preprint arXiv:2511.07479},
  year   = {2025}
}