中文

LLaFEA:用于 LMM 细粒度时空理解的帧-事件互补融合

计算机视觉与模式识别 2025-03-11 v1

摘要

大型多模态模型 在场景理解方面表现出色,但由于语言和视觉表示之间的对齐较弱,在细粒度时空推理方面存在困难。现有方法将文本位置和持续时间映射到从基于帧的视频中编码的视觉空间,但存在时间稀疏性,限制了语言-视觉的时间协调。为了解决这个问题,我们引入了 LLaFEA (Large Language and Frame-Event Assistant),以利用事件相机进行时间密集感知和帧-事件融合。我们的方法采用交叉注意力机制来整合互补的空间和时间特征,随后通过自注意力匹配实现全局时空关联。我们进一步将文本位置和持续时间标记嵌入到融合的视觉空间中,以增强细粒度对齐。这个统一框架确保了稳健的时空坐标对齐,使 LMM 能够在任何位置和任何时间解释场景。此外,我们构建了一个带有坐标指令的真实世界帧-事件数据集,并进行了大量实验以验证所提出方法的有效性。

关键词

引用

@article{arxiv.2503.06934,
  title  = {LLaFEA: Frame-Event Complementary Fusion for Fine-Grained Spatiotemporal Understanding in LMMs},
  author = {Hanyu Zhou and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2503.06934},
  year   = {2025}
}