$x^2$-融合:事件边缘空间中的跨模态和跨维度流估计
计算机视觉与模式识别
2026-03-18 v1
摘要
估计稠密2D光流和3D场景流对于动态场景理解至关重要。最近的工作将图像、LiDAR和事件数据组合在一起联合预测2D和3D运动,但大多数方法在各个异构特征空间中运行。在没有统一的潜在空间让所有模态对齐的情况下,这些系统依赖于多个模态特定的模块,留下了跨传感器不匹配问题,使得融合不必要地复杂化。事件摄像头天然提供时空边信号,我们可将其作为内在边场来锚定统一的潜在表示,称为事件边缘空间。基于这一思想,我们引入-融合,将多模态融合重新框定为表示统一:由事件导出的时空边缘定义一个以边为中心的均匀空间,图像和LiDAR特征在此共享表示中显式对齐。在此空间中,我们执行可靠性感知的自适应融合以估计模态可靠性并强调在退化情况下的稳定线索。我们进一步采用跨维度对比学习紧密耦合2D光流与3D场景流。大量实验表明,-Fusion 在标准条件下实现了最先进的精度,并在具有挑战性的场景中显著提升。
引用
@article{arxiv.2603.16671,
title = {$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space},
author = {Ruishan Guo and Ciyu Ruan and Haoyang Wang and Zihang Gong and Jingao Xu and Xinlei Chen},
journal= {arXiv preprint arXiv:2603.16671},
year = {2026}
}
备注
This version is the camera-ready version accepted at CVPR 2026