中文

IUT-Plug:显式结构记忆用于交错图像-文本生成的一致性提升

计算机视觉与模式识别 2026-01-01 v3

摘要

现有的视觉语言模型(VLMs)在处理持续的交错图像-文本交互时,常常难以保持逻辑、实体身份和艺术风格的一致性。我们识别出这一局限性为“多模态上下文漂移”,其根源在于隐式神经表征在长序列中退化或纠缠的内在倾向。为弥合这一差距,我们提出了 IUT-Plug,这是一种模型无关的神经符号结构状态跟踪机制。不同于依赖瞬时注意图的纯神经方法,IUT-Plug 引入了图像理解树(IUT)作为显式、持久的记忆模块。该框架通过 (1) 将视觉场景解析为层次符号结构(实体、属性和关系);(2) 执行增量状态更新,以逻辑锁定不变属性同时修改变化元素;(3) 通过拓扑约束引导生成。我们在一个新建基准上进行评估,该基准包含 3000 个人工标注样本。实验结果表明,IUT-Plug 有效缓解了上下文漂移,相较于无结构文本提示基线实现了显著提升的一致性得分。这一发现确认了显式符号 grounding 对维持多模态生成中稳健的长期一致性至关重要。

关键词

引用

@article{arxiv.2510.10969,
  title  = {Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation},
  author = {Zeteng Lin and Xingxing Li and Wen You and Xiaoyang Li and Zehan Lu and Yujun Cai and Jing Tang},
  journal= {arXiv preprint arXiv:2510.10969},
  year   = {2026}
}