桥接帧与事件:面向高动态场景光流的通用时空融合
计算机视觉与模式识别
2025-03-12 v2
摘要
高动态场景光流是一项具有挑战性的任务,由于帧成像中的大位移会导致空间模糊和时间上的运动不连续,从而恶化光流的时空特征。通常,现有方法主要引入事件相机来直接融合两种模态之间的时空特征。然而,这种直接融合是无效的,因为帧与事件模态之间异构的数据表示存在巨大差异。为了解决这个问题,我们探索将一个共享潜在空间作为中间桥梁以缓解模态差异。在本工作中,我们针对高动态场景光流提出了一种新颖的帧与事件模态间的通用时空融合方法,包括视觉边界定位和运动相关性融合。具体而言,在视觉边界定位中,我们发现帧与事件具有相似的时空梯度,其相似性分布与提取的边界分布相一致。这促使我们设计通用时空梯度来约束参考边界定位。在运动相关性融合中,我们发现基于帧的运动具有空间密集但时间不连续的相关性,而基于事件的运动具有空间稀疏但时间连续的相关性。这启发我们利用参考边界来指导两种模态之间的互补运动知识融合。此外,通用时空融合不仅能缓解跨模态特征差异,还能使融合过程对于密集且连续的光流具有可解释性。进行了大量实验以验证所提方法的优越性。
引用
@article{arxiv.2503.06992,
title = {Bridge Frame and Event: Common Spatiotemporal Fusion for High-Dynamic Scene Optical Flow},
author = {Hanyu Zhou and Haonan Wang and Haoyue Liu and Yuxing Duan and Yi Chang and Luxin Yan},
journal= {arXiv preprint arXiv:2503.06992},
year = {2025}
}