提前思考:MLLMs 与世界模型中的前瞻智能
计算机视觉与模式识别
2025-12-12 v2 人工智能
摘要
本文定义了前瞻智能(Foresight Intelligence)为对未来事件进行预判和解读的能力——这是一项对于自动驾驶等应用至关重要的能力,却在现有研究中鲜有关注。为弥合这一差距,我们引入了 FSU-QA,这是一个新构建的视觉问答(VQA)数据集,专为激发和评估前瞻智能而设计。通过 FSU-QA,我们对视觉语言模型(VLMs)在前瞻导向任务下的表现进行了首次全面研究,揭示了当前模型在推理未来情境方面仍存在挑战。除了作为基准之外,FSU-QA还能通过衡量其生成预测的语义连贯性来评估世界模型——即当 VLMs 辅以此类输出时所带来的性能提升。我们的实验进一步表明,FSU-QA 能够有效提升前瞻推理:即使是规模较小的 VLMs 在 FSU-QA 上微调后,也能以显著的优势超越更大更先进的模型。综上所述,这些发现将 FSU-QA 定位为为开发能真正预判和理解未来事件的下一代模型奠定了原则性基础。
引用
@article{arxiv.2511.18735,
title = {Thinking Ahead: Foresight Intelligence in MLLMs and World Models},
author = {Zhantao Gong and Liaoyuan Fan and Qing Guo and Xun Xu and Xulei Yang and Shijie Li},
journal= {arXiv preprint arXiv:2511.18735},
year = {2025}
}
备注
25 pages, 27 figures