中文

Proxy-Tuning:面向主体驱动图像生成的多模态自回归模型定制化

计算机视觉与模式识别 2025-12-02 v2 多媒体

摘要

多模态自回归(AR)模型基于下一标记预测和Transformer架构,在包括文本到图像(T2I)生成在内的各种多模态任务中展现出惊人的能力。尽管在通用T2I任务中表现优异,但我们的研究发现,这些模型在主体驱动图像生成方面不如占主导地位的扩散模型。为此,我们引入Proxy-Tuning,利用扩散模型来增强AR模型在主体特定图像生成方面的能力。我们的方法揭示了惊人的弱到强现象:微调后的AR模型在主体忠实度和提示遵循度方面始终优于其扩散模型主管。我们分析了这一性能变化,确定了AR模型在哪些场景中表现突出,特别是在多主体组合和情境理解方面。这项工作不仅在主体驱动AR图像生成方面取得了令人印象深刻的结果,还揭示了图像生成领域的弱到强泛化潜力,深化了对不同架构优势与局限性的理解。

关键词

引用

@article{arxiv.2503.10125,
  title  = {Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation},
  author = {Yi Wu and Shengju Qian and Lingting Zhu and Lei Liu and Wandi Qiao and Ziqiang Li and Lequan Yu and Bin Li},
  journal= {arXiv preprint arXiv:2503.10125},
  year   = {2025}
}