统一多模态模型能可靠生成图像多久?通过上下文精选驯化长时段交错图像生成
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
统一多模态模型有望生成大量交错叙事, 将文本与图像编织成连贯的长篇故事。然而,当前系统存在关键可靠性差距:随着序列长度增长,生成质量迅速崩溃。本文调查了这一失效机制,认为其不同于标准的长上下文挑战。我们揭示在生成过程中,累积的视觉历史作为活跃污染源,其衰减具体由图像事件数量而非原始 token 数决定。我们识别出一种结构性脆弱点:密集的视觉 token 压倒注意力机制,创建扰动未来合成的噪声。基于这些机制性洞见,我们提出了 UniLongGen,一种无需训练的推理策略,优先考虑安全的条件化而非总体记忆。无需保留全部历史,UniLongGen 动态精选模型的记忆,基于模型自身内部的相关性排名识别并丢弃干扰视觉信号。广泛的实验表明,这种主动遗忘方法对稳定性至关重要:UniLongGen 在长程忠诚度和一致性方面显著优于基线,同时减少了内存占用和推理时间。
引用
@article{arxiv.2603.07540,
title = {How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation},
author = {Haoyu Chen and Qing Liu and Yuqian Zhou and He Zhang and Zhaowen Wang and Mengwei Ren and Jingjing Ren and Xiang Wang and Zhe Lin and Lei Zhu},
journal= {arXiv preprint arXiv:2603.07540},
year = {2026}
}