交错分析-起草思维:统一视觉语言模型中的理解与生成
计算机视觉与模式识别
2026-03-18 v2
摘要
统一视觉语言模型 (UVLM) 旨在通过支持单一框架内的理解和生成来推进多模态学习。然而,现有方法主要关注架构统一,忽视了在任务解决过程中需要显式的理解与生成之间的交互。结果是,当前模型将理解和生成视为平行技能,而非协同过程。为实现真正的协同,我们引入了交错分析-起草问题解决循环 (AD-Loop),这是一种新的思维范式,通过在分析操作和起草操作之间动态交替,实现文本思维与视觉思维的交错,从而使模型能够迭代细化两者的理解和输出,培育真正的协同。为训练此机制,我们设计了两阶段策略:在交错思维数据上进行监督学习以初始化交替,随后通过强化学习以促进自适应和自主控制。广泛的实验表明,AD-Loop 在标准理解和生成基准测试中均一致改进性能,并对各种 UVLMM 架构具有强大的可迁移性。视觉分析进一步验证了隐式视觉思维的有效性。这些结果将 AD-Loop 确立为 synergizing 理解与创造的原则方法和广泛适用策略。项目页面位于 https://sqwu.top/AD-Loop。
引用
@article{arxiv.2602.21435,
title = {Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking},
author = {Shengqiong Wu and Bobo Li and Xinkai Wang and Xiangtai Li and Lei Cui and Furu Wei and Shuicheng Yan and Hao Fei and Tat-seng Chua},
journal= {arXiv preprint arXiv:2602.21435},
year = {2026}
}
备注
28 pages, 17 figures, 6 tables, ICLR conference