PixWizard:基于开放语言指令的通用图像到图像视觉助手
计算机视觉与模式识别
2025-02-28 v4
摘要
本文提出一种通用的图像到图像视觉助手PixWizard,旨在基于free-from语言指令进行图像生成、操作和翻译。为此,我们将various视觉任务整合为统一的图像-文本到图像生成框架,并构建了Omni Pixel-to-Pixel Instruction-Tuning数据集。通过构建详细的自然语言指令模板,我们全面包含大量多样化的视觉任务,如文本到图像生成、图像修复、图像定位、密集图像预测、图像编辑、可控生成、inpainting/outpainting等。此外,我们采用Diffusion Transformers(DiT)作为基础模型,并通过灵活的any resolution机制扩展其能力,使模型能够根据输入图像的宽高比动态处理图像,紧密符合人类感知过程。该模型还包含structure-aware和semantic-aware指导,以促进输入图像信息的有效融合。我们的实验表明,PixWizard不仅在各种分辨率的图像上展现出惊人的生成和理解能力,而且在未见任务和人类指令方面也表现出良好的泛化能力。代码和相关资源已发布于https://github.com/AFeng-x/PixWizard。
引用
@article{arxiv.2409.15278,
title = {PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions},
author = {Weifeng Lin and Xinyu Wei and Renrui Zhang and Le Zhuo and Shitian Zhao and Siyuan Huang and Huan Teng and Junlin Xie and Yu Qiao and Peng Gao and Hongsheng Li},
journal= {arXiv preprint arXiv:2409.15278},
year = {2025}
}
备注
Code is released at https://github.com/AFeng-x/PixWizard