中文

编织光与时间:用于密集 RGB-事件联合解析的统一谐波-几何表示学习

计算机视觉与模式识别 2026-07-10 v1

摘要

将标准 RGB 帧与异步事件流融合已成为在退化环境中进行鲁棒感知的确定性范式。尽管统一骨干网络近来在多模态视觉领域受到关注,但将其应用于 RGB-事件领域仍面临根本性挑战。现有架构要么采用解耦的双编码器,使计算开销加倍,要么采用通用的统一设计,无法解决密集强度网格与稀疏运动尖峰之间极端表示差异下的隐式几何视差和跨光谱混叠问题。为突破这些瓶颈,我们提出了 Evita,这是首个专门为密集 RGB-事件联合解析设计的统一骨干网络。为实现深度的模态协同,Evita 将一组内在共学习模块显式嵌入到每个编码器层中。具体而言,它包含用于自适应空间对齐的几何视差校正模块、仅在复数频域进行纹理传递的谐波谱共振模块,以及用于事件驱动非对称注意力的瞬态全局路由模块。为确保对空间错位的鲁棒特征提取,并将表示与特定事件编码解耦,我们构建了 N-ImageNetV2 以及一种随机事件表示混合预训练协议,使网络能够无缝适应下游任务中的任意事件格式。在 DELIVER、DDD17 和 DSEC 基准上的大量评估证实,Evita 在实时多模态感知中确立了新的最先进指标,同时提供了卓越的精度-延迟权衡。代码公开于:https://github.com/chaineypung/Evita。

关键词

引用

@article{arxiv.2607.09143,
  title  = {Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing},
  author = {Chenxu Peng and Chongtian zhou and Dicheng Liu and Bo-Wen Yin and Yimian Dai and Xialei Liu and Ming-Ming Cheng and Xiang Li},
  journal= {arXiv preprint arXiv:2607.09143},
  year   = {2026}
}