将事件引入 RGB 和 LiDAR:用于场景流的层次化视觉 - 运动融合
计算机视觉与模式识别
2024-03-13 v1
摘要
单一 RGB 或 LiDAR 是挑战性场景流任务的主流传感器,其严重依赖视觉特征来匹配运动特征。与单一模态相比,现有方法采用融合策略直接在运动空间中融合跨模态互补知识。然而,由于 RGB 和 LiDAR 之间视觉内在的异质性,这些直接融合方法可能会遭受模态差距,从而恶化运动特征。我们发现事件在视觉和运动空间中都与 RGB 和 LiDAR 具有同质性。在这项工作中,我们将事件作为 RGB 和 LiDAR 之间的桥梁,并提出了一种用于场景流的新型层次化视觉 - 运动融合框架,该框架探索了一个同质空间以融合跨模态互补知识进行物理解释。在视觉融合中,我们发现事件在亮度空间中与 RGB 具有互补性(相对 vs. 绝对),适用于高动态成像;在场景结构空间中与 LiDAR 具有互补性(局部边界 vs. 全局形状),适用于结构完整性。在运动融合中,我们指出 RGB、事件和 LiDAR 在相关空间中彼此互补(空间密集、时间密集 vs. 时空稀疏),这促使我们融合它们的运动相关性以实现运动连续性。所提出的层次化融合可以显式地融合多模态知识,从而从视觉空间到运动空间逐步改善场景流。进行了大量实验以验证所提出方法的优越性。
引用
@article{arxiv.2403.07432,
title = {Bring Event into RGB and LiDAR: Hierarchical Visual-Motion Fusion for Scene Flow},
author = {Hanyu Zhou and Yi Chang and Zhiwei Shi and Luxin Yan},
journal= {arXiv preprint arXiv:2403.07432},
year = {2024}
}