MENTOR:用于自回归视觉生成模型的高效多模态条件调优
计算机视觉与模式识别
2026-05-29 v3 人工智能
计算与语言
摘要
近期文本到图像模型虽然产生高质量结果,但仍在精确视觉控制、多模态输入平衡以及复杂多模态图像生成方面需要大量训练。为解决这些限制,我们提出MENTOR,这是一个 novel autoregressive (AR) framework for efficient Multimodal-conditioned Tuning for Autoregressive multimodal image generation。MENTOR将AR图像生成器与两阶段训练范式相结合,使多模态输入与图像输出之间实现细粒度、token级的对齐,而无需依赖辅助适配器或跨注意力模块。两阶段训练包括:(1)多模态对齐阶段,用于建立鲁棒的像素级和语义级对齐,随后是(2)多模态指令调优阶段,用于平衡多模态输入的集成并增强生成可控性。尽管模型规模适中、基线组件次优且训练资源有限,MENTOR仍在DreamBench++基准上取得优异成绩,在概念保持和提示跟随方面超越了竞争性基线。此外,我们的方法在图像重建保真度、任务适应性和训练效率方面均优于基于扩散的方法。数据集、代码和模型均可用:https://github.com/HaozheZhao/MENTOR
引用
@article{arxiv.2507.09574,
title = {MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models},
author = {Haozhe Zhao and Zefan Cai and Shuzheng Si and Liang Chen and Jiuxiang Gu and Wen Xiao and Minjia Zhang and Junjie Hu},
journal= {arXiv preprint arXiv:2507.09574},
year = {2026}
}
备注
Findings of ACL 2026