中文

高效示例驱动图像编辑的多模态 VLMs

软件工程 2025-12-04 v2 人工智能

摘要

文本到图像扩散模型已使图像编辑应用程序实现广泛应用。然而,仅通过文本捕捉所有类型的编辑都可能具有挑战性和繁琐性。某些图像编辑的模糊性更适合通过示例对来表达,即描述图像编辑前后状态的图像对。在本工作中,我们通过利用预训练的文本到图像扩散模型和多模态 VLMs 来解决示例驱动图像编辑——将示例对中的编辑从内容图像(s) transferring 的任务。尽管我们的端到端管道无需优化,但实验结果表明,它在多种编辑类型上仍优于基线方法,速度约为基线方法的 4 倍。

关键词

引用

@article{arxiv.2506.20159,
  title  = {AI and Agile Software Development: From Frustration to Success -- XP2025 Workshop Summary},
  author = {Tomas Herda and Victoria Pichler and Zheying Zhang and Pekka Abrahamsson and Geir K. Hanssen},
  journal= {arXiv preprint arXiv:2506.20159},
  year   = {2025}
}