重建作为事件驱动视觉问答的桥梁
计算机视觉与模式识别
2025-12-15 v1
摘要
将事件相机与多模态大语言模型(MLLMs)集成,有望在具有挑战性的视觉条件下实现通用场景理解,但需要在保留事件数据的独特优势与确保与基于帧的模型兼容之间取得权衡。我们通过使用重建作为桥梁来解决这一挑战,提出了一种简单的基于帧的重建与分词(FRT)方法,并设计了一种高效的自适应重建与分词(ART)方法,利用事件稀疏性。为了进行稳健的评估,我们引入了 EvQA,这是第一个面向事件驱动 MLLMs 的客观真实世界基准,包含来自 22 个公共数据集的 1000 个事件问答对。我们的实验表明,我们的方法在 EvQA 上达到了最先进的性能,突显了 MLLMs 在事件驱动视觉中的巨大潜力。
引用
@article{arxiv.2512.11510,
title = {Reconstruction as a Bridge for Event-Based Visual Question Answering},
author = {Hanyue Lou and Jiayi Zhou and Yang Zhang and Boyu Li and Yi Wang and Guangnan Ye and Boxin Shi},
journal= {arXiv preprint arXiv:2512.11510},
year = {2025}
}