中文

借助多模态大语言模型中的事件流学习应对极端光照

计算机视觉与模式识别 2026-03-31 v1

摘要

多模态大语言模型(MLLMs)在标准条件下表现出强大的视觉-语言推理能力,但在极端光照下会失效,此时RGB输入会不可逆地丢失结构和语义。我们提出Event-MLLM,一个事件增强模型,通过动态融合事件流与RGB帧来执行全光照视觉推理。我们的方法由两个关键组件驱动:光照指示器——源自DINOv2分支的可学习信号,表示曝光退化并自适应调节事件-RGB融合;以及光照校正损失,在潜空间中对齐融合特征与非退化(正常光照)语义,补偿极端光照下丢失的信息。我们为MLLM整理了首个多光照事件-指令语料库,包含2241个事件-RGB样本(每个约6个问答对),涵盖多样场景和17种亮度率(0.05x-20x),以及一个用于极端光照下推理、计数和细粒度识别的指令遵循基准。实验表明,Event-MLLM显著优于通用型、光照自适应和仅事件基线,在鲁棒多模态感知和推理方面达到了新的最先进水平。

关键词

引用

@article{arxiv.2603.27558,
  title  = {Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models},
  author = {Baoheng Zhang and Jiahui Liu and Gui Zhao and Weizhou Zhang and Yixuan Ma and Jun Jiang and Yingxian Chen and Wilton W. T. Fok and Xiaojuan Qi and Hayden Kwok-Hay So},
  journal= {arXiv preprint arXiv:2603.27558},
  year   = {2026}
}

备注

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026