REALM:用于跨模态感知的 RGB 和 Event 对齐潜在流形
计算机视觉与模式识别
2026-05-05 v2 人工智能
机器人学
摘要
Event 相机相对于标准 frame-based 传感器提供了若干独特优势,包括高时空分辨率、低延迟和对极端照明的鲁棒性。然而,现有的基于学习的 event 处理方法通常局限于狭窄、任务特定的 silos,缺乏跨模态泛化能力。我们通过将 event 表示投射到 RGB foundation models 的预训练潜在空间中,学习一个 RGB 和 Event 对齐的潜在流形来弥补这一差距。我们利用 low-rank adaptation (LoRA) 跨越模态鸿沟,有效地将冻结的 RGB backbones 的几何和语义先验解锁给异步 event 流。我们证明了 REALM 有效地将 events 映射到 ViT-based foundation latent space。我们的方法允许我们通过简单地将在 RGB teacher 上训练的线性 heads 迁移到 event 数据上,执行诸如深度估计和语义分割等下游任务。最显著的是,REALM 使我们能够直接、零样本地将复杂的、冻结的 image-trained 解码器(如 MASt3R)应用于 raw event 数据。我们在宽基准 feature matching 中实现了 state-of-the-art performance,显著优于专用架构。代码和模型将在接受后公开。
引用
@article{arxiv.2605.00271,
title = {REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception},
author = {Vincenzo Polizzi and David B. Lindell and Jonathan Kelly},
journal= {arXiv preprint arXiv:2605.00271},
year = {2026}
}