TransiT:面向非视距摄像的瞬态 Transformer
计算机视觉与模式识别
2025-03-17 v1
摘要
使用非视距成像的高质量、高速摄像有益于自主导航、防撞以及灾后搜救任务。目前的解决方案必须在帧率和图像质量之间取得平衡。例如,可以通过减少逐点扫描时间或扫描密度来实现高帧率,但这以降低单帧的信息密度为代价。快速扫描过程进一步降低了信噪比,且不同的扫描系统表现出不同的失真特征。在这项工作中,我们设计并采用了一种名为 TransiT 的新型瞬态 Transformer 架构,以在快速扫描下实现实时 NLOS 恢复。TransiT 直接压缩输入瞬态的时间维度以提取特征,降低了计算成本并满足了高帧率要求。它进一步采用了特征融合机制,并利用时空 Transformer 来帮助捕获 NLOS 瞬态视频的特征。此外,TransiT 应用迁移学习来弥合合成数据与实测数据之间的差距。在真实实验中,TransiT 成功地将每点 0.4 ms 曝光时间下测得的 稀疏瞬态重建为 分辨率、每秒 10 帧的 NLOS 视频。我们将向社区开放我们的代码和数据集。
关键词
引用
@article{arxiv.2503.11328,
title = {TransiT: Transient Transformer for Non-line-of-sight Videography},
author = {Ruiqian Li and Siyuan Shen and Suan Xia and Ziheng Wang and Xingyue Peng and Chengxuan Song and Yingsheng Zhu and Tao Wu and Shiying Li and Jingyi Yu},
journal= {arXiv preprint arXiv:2503.11328},
year = {2025}
}