中文

提升自回归图像生成的链条思考效率

计算机视觉与模式识别 2025-10-08 v1 人工智能 计算与语言

摘要

自回归多模态大语言模型近期在图像生成领域获得了广泛关注,这得益于基础模型的进步。为提升对齐度与细节,新方法采用链条思考(CoT)推理,将用户输入扩展为精心构造的提示后再进行图像合成。然而,这一策略可能引入不必要的冗余——我们将其称为视觉过思考——从而增加计算成本并可能生成与原始提示相矛盾的细节。本文探索如何生成更简洁的 CoT 序列以实现更高效的图像生成。我们提出了 ShortCoTI——一种轻量级优化框架,通过自适应函数奖励更简洁的提示(该函数根据每个任务估计的难度进行比例调整),从而鼓励保持输出图像质量的同时实现更简洁的推理。将该奖励机制引入强化学习范式后,提示推理长度缩短 54%,且在多个基准测试(T2I-CompBench、GenEval)上保持或略微提升质量指标。定性分析显示,我们的方法消除了冗长的解释和重复的细化,生成既简洁又富有语义的推理提示。结果表明,ShortCoTI 在不损害生成图像忠实度和视觉吸引力的前提下,显著提升了计算效率。

关键词

引用

@article{arxiv.2510.05593,
  title  = {Improving Chain-of-Thought Efficiency for Autoregressive Image Generation},
  author = {Zeqi Gu and Markos Georgopoulos and Xiaoliang Dai and Marjan Ghazvininejad and Chu Wang and Felix Juefei-Xu and Kunpeng Li and Yujun Shi and Zecheng He and Zijian He and Jiawei Zhou and Abe Davis and Jialiang Wang},
  journal= {arXiv preprint arXiv:2510.05593},
  year   = {2025}
}