中文

FutureOmni:评估多模态大语言模型基于全模态上下文的未来预测能力

计算与语言 2026-01-21 v1 计算机视觉与模式识别 多媒体

摘要

尽管多模态大语言模型(MLLMs)展现出强大的全模态感知能力,但其从视听线索中预测未来事件的能力在很大程度上仍未得到探索,因为现有基准主要侧重于回顾性理解。为弥合这一差距,我们引入了FutureOmni,这是首个旨在评估视听环境中全模态未来预测能力的基准。被评估的模型需要执行跨模态的因果和时间推理,并有效利用内部知识来预测未来事件。FutureOmni通过一个可扩展的、由大语言模型辅助且包含人工参与的流程构建而成,包含919个视频和1034个多项选择问答对,涵盖8个主要领域。对13个全模态模型和7个纯视频模型的评估表明,当前系统在视听未来预测方面存在困难,尤其是在语音密集的场景中,最佳准确率由Gemini 3 Flash取得,为64.8%。为缓解这一局限性,我们整理了一个包含7千样本的指令微调数据集,并提出了一种全模态未来预测(OFF)训练策略。在FutureOmni以及流行的视听和纯视频基准上的评估表明,OFF增强了未来预测和泛化能力。我们公开发布所有代码(https://github.com/OpenMOSS/FutureOmni)和数据集(https://huggingface.co/datasets/OpenMOSS-Team/FutureOmni)。

关键词

引用

@article{arxiv.2601.13836,
  title  = {FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs},
  author = {Qian Chen and Jinlan Fu and Changsong Li and See-Kiong Ng and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2601.13836},
  year   = {2026}
}

备注

https://openmoss.github.io/FutureOmni