基于多模态Transformer的统一图像指令适配器
计算机视觉与模式识别
2024-12-30 v1 机器学习
摘要
最近,文本到图像生成模型取得了显著进展,尤其是扩散模型促进了从文本描述中进行高质量图像合成。然而,这些模型通常难以仅凭文本提示实现对像素级布局、物体外观和全局风格的精确控制。为缓解此问题,先前的工作引入条件图像作为图像生成的辅助输入,以增强控制,但通常需要针对不同类型的参考输入定制专门模型。在本文中,我们探索了一种在单个框架内统一可控生成的新方法。具体而言,我们提出了基于多模态扩散Transformer架构构建的统一图像指令适配器(UNIC-Adapter),以实现无需多个专门模型即可实现多样化条件下的灵活且可控的生成。我们的UNIC-Adapter通过融合条件图像和任务指令,有效提取多模态指令信息,并通过增强旋转位置嵌入的交叉注意力机制将此信息注入图像生成过程。针对像素级空间控制、主体驱动图像生成和风格图像基图像合成等多种任务的实验结果表明,我们的UNIC-Adapter在统一可控图像生成方面效果显著。
引用
@article{arxiv.2412.18928,
title = {UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation},
author = {Lunhao Duan and Shanshan Zhao and Wenjun Yan and Yinglun Li and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and Mingming Gong and Gui-Song Xia},
journal= {arXiv preprint arXiv:2412.18928},
year = {2024}
}