中文

基于扩散 U-Net 交叉注意力图的 LLM 指导下的实例级图像操控

计算机视觉与模式识别 2025-01-27 v1

摘要

文本到图像合成的不断进步引入了强大的生成模型,能够从文本提示中创建逼真的图像。然而,针对图像属性进行精确控制仍然具有挑战性,尤其是在实例级别。虽然现有方法通过微调或辅助信息提供了一些控制,但往往在灵活性和准确性方面受到限制。为此,我们提出了一种利用大型语言模型(LLMs)、开放词汇检测器、交叉注意力图和扩散 U-Net 中间激活的管道,用于实例级图像操控。该方法检测文本提示中提及且存在于生成图像中的对象,从而 enable 在无需 extensive training 或输入掩码的情况下进行精确操控。通过融入交叉注意力图,我们的方法确保操控后图像的一致性,同时控制对象位置。该方法 enable 在无需微调或辅助信息(如掩码或边界框)的情况下进行实例级精确操控。代码可在 https://github.com/Palandr123/DiffusionU-NetLLM 获取。

关键词

引用

@article{arxiv.2501.14046,
  title  = {LLM-guided Instance-level Image Manipulation with Diffusion U-Net Cross-Attention Maps},
  author = {Andrey Palaev and Adil Khan and Syed M. Ahsan Kazmi},
  journal= {arXiv preprint arXiv:2501.14046},
  year   = {2025}
}

备注

Presented at BMVC 2024