中文

Merlin:赋予多模态大语言模型前瞻思维

计算机视觉与模式识别 2024-07-04 v2

摘要

人类拥有基于当前观察在一定程度上预见未来的非凡能力,我们将这种技能称为前瞻思维。然而,这一能力在现有的多模态大语言模型(MLLMs)中基本上未被探索,阻碍了它们学习事物运作的基本原理以及被观察主体背后意图的能力。为解决此问题,我们将未来建模引入到MLLMs的现有学习框架中。通过利用主体轨迹(subject trajectory,一种连续帧序列的高度结构化表示)作为学习目标,我们旨在弥合过去与未来之间的差距。我们提出两种创新方法来赋予MLLMs前瞻思维:前瞻预训练(Foresight Pre-Training, FPT)和前瞻指令微调(Foresight Instruction-Tuning, FIT),其灵感来自LLMs的现代学习范式。具体而言,FPT联合训练以轨迹为中心的各种任务,使MLLMs能够学习如何从给定的初始观察中关注并预测整个轨迹。然后,FIT要求MLLMs首先预测相关对象的轨迹,并基于这些轨迹推理潜在的未来事件。在FPT和FIT的辅助下,我们构建了一个新颖且统一的多模态大语言模型Merlin,它支持多图像输入并分析多个对象在未来推理中的潜在动作。实验结果表明,Merlin具有强大的前瞻思维,在未来的推理和视觉理解任务上均取得了令人印象深刻的性能。

关键词

引用

@article{arxiv.2312.00589,
  title  = {Merlin:Empowering Multimodal LLMs with Foresight Minds},
  author = {En Yu and Liang Zhao and Yana Wei and Jinrong Yang and Dongming Wu and Lingyu Kong and Haoran Wei and Tiancai Wang and Zheng Ge and Xiangyu Zhang and Wenbing Tao},
  journal= {arXiv preprint arXiv:2312.00589},
  year   = {2024}
}

备注

Accepted by ECCV2024. Project page: https://ahnsun.github.io/merlin