面向高效示例驱动图像编辑的多模态 VLMs
计算机视觉与模式识别
2025-06-26 v1
摘要
文本到图像扩散模型已使图像编辑应用程序实现广泛应用。然而,仅通过文本捕捉所有类型的编辑都可能具有挑战性和繁琐性。某些图像编辑的模糊性更适合通过示例对来表达,即描述图像编辑前后状态的图像对。在本工作中,我们通过利用预训练的文本到图像扩散模型和多模态 VLMs 来解决示例驱动图像编辑——将示例对中的编辑从内容图像 transferring 的任务。尽管我们的端到端管道无需优化,但实验结果表明,它在多种编辑类型上仍优于基线方法,速度约为基线方法的 4 倍。
引用
@article{arxiv.2506.20155,
title = {Towards Efficient Exemplar Based Image Editing with Multimodal VLMs},
author = {Avadhoot Jadhav and Ashutosh Srivastava and Abhinav Java and Silky Singh and Tarun Ram Menta and Surgan Jandial and Balaji Krishnamurthy},
journal= {arXiv preprint arXiv:2506.20155},
year = {2025}
}
备注
Accepted at ECCV 2024 (AI4VA Workshop)