超越视场:利用片段循环 Transformer 增强场景可见性与感知
摘要
视觉传感器广泛应用于车辆、机器人和路侧基础设施中。然而,受限于硬件成本与系统尺寸,相机视场(Field-of-View, FoV)往往受限,可能无法提供充足覆盖。尽管如此,从时空视角看,有望从过往视频流中获取超出相机物理视场的信息。本文提出面向自动驾驶车辆的在线视频修复概念以扩展视场,从而增强场景可见性、感知与系统安全性。为此,我们引入 FlowLens 架构,其显式利用光流并隐式结合一种新颖的片段循环 Transformer 进行特征传播。FlowLens 具有两个关键特性:1) FlowLens 包含新设计的带 3D 解耦交叉注意力(3D-Decoupled Cross Attention, DDCA)的片段循环枢纽(Clip-Recurrent Hub),以逐步处理随时间累积的全局信息。2) 其集成多分支混合融合前馈网络(Mix Fusion Feed Forward Network, MixF3N)以增强局部特征的精确空间流动。为便于训练与评估,我们基于 KITTI360 数据集推导出带有多种视场掩码的数据集,涵盖外视场与内视场扩展场景。我们还对不同模型的超越视场语义与超越视场目标检测进行了定量评估与定性比较。我们说明,即便利用 FlowLens 重建未见场景,也可通过提供可靠语义上下文来增强视场内的感知。涉及离线与在线视频修复以及超越视场感知任务的大量实验与用户研究表明,FlowLens 取得了最先进的(state-of-the-art, SOTA)性能。源代码与数据集已公开于 https://github.com/MasterHow/FlowLens。
引用
@article{arxiv.2211.11293,
title = {Beyond the Field-of-View: Enhancing Scene Visibility and Perception with Clip-Recurrent Transformer},
author = {Hao Shi and Qi Jiang and Kailun Yang and Xiaoting Yin and Ze Wang and Kaiwei Wang},
journal= {arXiv preprint arXiv:2211.11293},
year = {2024}
}
备注
Accepted to IEEE Transactions on Intelligent Vehicles (T-IV). The source code and dataset are made publicly available at https://github.com/MasterHow/FlowLens