面向线上剧情记忆问答的无需额外训练的即插即用多模态大语言模型能达到什么高度?
计算机视觉与模式识别
2025-06-23 v1
摘要
我们探讨了即插即用多模态大语言模型(MLLM)在无需额外训练的情况下能否解决线上剧情记忆视频问答(OEM-VQA)问题。我们的管道通过一种MLLM描述模块,将流式三维眼动视频转换为轻量级文本记忆(仅需每分钟几千字节),并通过一种LLM推理模块查询该记忆来回答多选问题。在QAEgo4D-Closed基准测试中,我们最佳配置达到了56.0%的准确率,存储仅需3.6 kB/分钟,匹配了专用最新系统的性能,同时内存效率提升了10**4/10**5倍。广泛的消融实验提供了对每个组件和设计选择作用的见解,并为未来研究的改进方向提供了启发。
引用
@article{arxiv.2506.16450,
title = {How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?},
author = {Giuseppe Lando and Rosario Forte and Giovanni Maria Farinella and Antonino Furnari},
journal= {arXiv preprint arXiv:2506.16450},
year = {2025}
}