ImageChain:推进多模态大语言模型中顺序图像到文本推理
计算机视觉与模式识别
2025-06-12 v2 计算与语言
机器学习
摘要
在多模态大语言模型(MLLMs)上进行图像序列推理仍是一个挑战。虽然最近的模型在预训练期间包含多图像数据,但仍难以识别顺序结构,常将图像独立处理。本工作引入 ImageChain 框架,通过将视觉序列建模为多轮对话,增强了 MLLMs 对图像数据的顺序推理能力。在 ImageChain 中,图像与对应的文本描述交错排列,形成受控对话,显式捕获时间依赖性和叙事进程。我们针对下一场景描述任务进行优化,该任务要求模型根据前序的视觉和文本线索生成对即将到来的场景的上下文感知描述。我们证明了该方法在下一场景描述任务上的性能提升——在 SimRate 指标(衡量与人工标注基准语义相似度)上实现平均提升,从 3.7% 提升至 19%。此外,ImageChain 在从漫画到机器人等应用场景中实现了稳健的零样本跨域性能。广泛的实验表明,在多模态、多轮对话设计下的指令调优是桥接静态图像理解与时序感知推理关键。
引用
@article{arxiv.2502.19409,
title = {ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models},
author = {Danae Sánchez Villegas and Ingo Ziegler and Desmond Elliott},
journal= {arXiv preprint arXiv:2502.19409},
year = {2025}
}
备注
Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate