X-Prompt:面向自回归视觉语言基础模型的通用情境图像生成
计算机视觉与模式识别
2025-08-28 v2 人工智能
机器学习
多媒体
摘要
情境生成是大型语言模型(LLM)开放任务通用性能力的关键组件。通过利用少量示例作为情境,LLM能够执行领域内和领域外任务。近期基于LLM构建的自回归视觉语言模型(VLM)在文本到图像生成方面展现了令人印象深刻的性能。然而,情境学习在通用图像生成任务中的潜力仍基本未被探索。为此,我们介绍X-Prompt,这是一种纯粹自回归大型视觉语言模型,旨在统一的情境学习框架内在广泛的已见和未见图像生成任务中提供竞争性能。X-Prompt包含一种专门设计,有效压缩情境示例中有价值的特征,支持更长的情境 token 序列,从而提高其对未知任务的泛化能力。统一的训练任务可同时处理文本和图像预测,使X-Prompt能够从情境示例中获得增强的任务感知,实现通用图像生成。广泛的实验验证了模型在多样化的已见图像生成任务和处理未知任务方面的性能。
引用
@article{arxiv.2412.01824,
title = {X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models},
author = {Zeyi Sun and Ziyang Chu and Pan Zhang and Tong Wu and Xiaoyi Dong and Yuhang Zang and Yuanjun Xiong and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2412.01824},
year = {2025}
}
备注
code: https://github.com/SunzeY/X-Prompt