中文

面向高效示例驱动图像编辑的多模态 VLMs

计算机视觉与模式识别 2025-06-26 v1

摘要

文本到图像扩散模型已使图像编辑应用程序实现广泛应用。然而,仅通过文本捕捉所有类型的编辑都可能具有挑战性和繁琐性。某些图像编辑的模糊性更适合通过示例对来表达,即描述图像编辑前后状态的图像对。在本工作中,我们通过利用预训练的文本到图像扩散模型和多模态 VLMs 来解决示例驱动图像编辑——将示例对中的编辑从内容图像 transferring 的任务。尽管我们的端到端管道无需优化,但实验结果表明,它在多种编辑类型上仍优于基线方法,速度约为基线方法的 4 倍。

关键词

引用

@article{arxiv.2506.20155,
  title  = {Towards Efficient Exemplar Based Image Editing with Multimodal VLMs},
  author = {Avadhoot Jadhav and Ashutosh Srivastava and Abhinav Java and Silky Singh and Tarun Ram Menta and Surgan Jandial and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2506.20155},
  year   = {2025}
}

备注

Accepted at ECCV 2024 (AI4VA Workshop)