中文

统一多模态模型能可靠生成图像多久?通过上下文精选驯化长时段交错图像生成

计算机视觉与模式识别 2026-03-10 v1 人工智能

摘要

统一多模态模型有望生成大量交错叙事, 将文本与图像编织成连贯的长篇故事。然而,当前系统存在关键可靠性差距:随着序列长度增长,生成质量迅速崩溃。本文调查了这一失效机制,认为其不同于标准的长上下文挑战。我们揭示在生成过程中,累积的视觉历史作为活跃污染源,其衰减具体由图像事件数量而非原始 token 数决定。我们识别出一种结构性脆弱点:密集的视觉 token 压倒注意力机制,创建扰动未来合成的噪声。基于这些机制性洞见,我们提出了 UniLongGen,一种无需训练的推理策略,优先考虑安全的条件化而非总体记忆。无需保留全部历史,UniLongGen 动态精选模型的记忆,基于模型自身内部的相关性排名识别并丢弃干扰视觉信号。广泛的实验表明,这种主动遗忘方法对稳定性至关重要:UniLongGen 在长程忠诚度和一致性方面显著优于基线,同时减少了内存占用和推理时间。

关键词

引用

@article{arxiv.2603.07540,
  title  = {How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation},
  author = {Haoyu Chen and Qing Liu and Yuqian Zhou and He Zhang and Zhaowen Wang and Mengwei Ren and Jingjing Ren and Xiang Wang and Zhe Lin and Lei Zhu},
  journal= {arXiv preprint arXiv:2603.07540},
  year   = {2026}
}