基于历史条件 MLLM 的非马尔可夫多轮对话式图像生成
计算机视觉与模式识别
2026-01-30 v1 人工智能
摘要
对话式图像生成需要模型在多轮交互中遵循用户指令,同时以交替出现的文本和图像构成的聊天历史为依据。虽然近期的多模态大语言模型(MLLMs)能够生成和编辑图像,但大多数现有的多轮基准和训练配方实际上是马尔可夫的:下一项输出主要依赖于最近的图像,从而允许通过忽略长程历史来实现捷径解决方案。本文我们正式化并针对更具挑战性的非马尔可夫情境进行工作,用户可引用更早的状态、撤销更改或引用数轮之前引入的实体。我们提出(i)非马尔可夫多轮数据构建策略,包括强制检索更早视觉状态的回滚式编辑和将名称与外观在多轮中绑定的基于名称的多轮个性化;(ii)具有标记级缓存的历史条件训练和推理框架,以防止多轮身份漂移;(iii)包括基于重建的 DiT 解词器和多阶段微调课程,以提升高保真图像重建和可编辑个性化。我们表明,针对非马尔可夫交互进行显式训练可在保持强大的单轮编辑和个性化的同时,显著提升多轮一致性和指令遵循度。
引用
@article{arxiv.2601.20911,
title = {Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs},
author = {Haochen Zhang and Animesh Sinha and Felix Juefei-Xu and Haoyu Ma and Kunpeng Li and Zhipeng Fan and Meng Dong and Xiaoliang Dai and Tingbo Hou and Peizhao Zhang and Zecheng He},
journal= {arXiv preprint arXiv:2601.20911},
year = {2026}
}
备注
19 pages, 19 figures, plan for TIP