LET-US:长时序事件-文本理解框架
计算机视觉与模式识别
2025-08-12 v1
摘要
事件相机输出具有微秒级时间分辨率的稀疏非同步事件流,实现低延迟且高动态范围的视觉感知。虽然现有多模态大语言模型(MLLM)在理解与分析RGB视频内容方面取得了显著成果,但它们要么无法有效解释事件流,要么受限于非常短的序列。本文引入LET-US,一个用于长事件流-文本理解的框架,采用自适应压缩机制以保留关键视觉细节的方式减少输入事件的体积。LET-US因此开创了基于事件序列的跨模态推理理解的新前沿。为弥合事件流与文本表示之间的巨大模态鸿沟,我们采用两阶段优化范式,逐步赋予模型解释事件基场景的能力。为处理长事件流中海量时序信息,我们利用文本引导的跨模态查询进行特征压缩,同时通过层次聚类与相似性计算提炼最具代表性的事件特征。此外,我们构建了大规模事件-文本对齐数据集用于模型训练,实现事件特征在LLM嵌入空间内的 tighter 对齐。我们还开发了涵盖reasoning、captioning、classification、temporal localization和moment retrieval等多样任务的综合基准。实验结果表明,LET-US在描述准确性和语义理解方面优于现有前沿MLLM,尤其在处理持续时长的事件流方面表现更佳。所有数据集、代码和模型将公开 disponible。
引用
@article{arxiv.2508.07401,
title = {LET-US: Long Event-Text Understanding of Scenes},
author = {Rui Chen and Xingyu Chen and Shaoan Wang and Shihan Kong and Junzhi Yu},
journal= {arXiv preprint arXiv:2508.07401},
year = {2025}
}