基于优化的多模态语义图像编辑
计算机视觉与模式识别
2023-11-29 v1 计算与语言
机器学习
摘要
图像编辑增强了对生成图像的美学与内容的控制。已有工作主要聚焦于基于文本的指令以实现所需的图像修改,这限制了编辑的精度与准确性。在本工作中,我们提出一种推理时编辑优化方法,旨在超越文本编辑以容纳多种编辑指令类型(例如基于空间布局的、姿态、涂鸦、边缘图)。我们提议将编辑任务解耦为两个相互竞争的子任务:成功的局部图像修改与全局内容一致性保持,其中子任务由两个不同的损失函数引导。通过允许调整每个损失函数的影响,我们构建了一个可依据用户偏好调节的灵活编辑方案。我们使用文本、姿态与涂鸦编辑条件评估了我们的方法,并通过定性与定量实验凸显了我们实现复杂编辑的能力。
引用
@article{arxiv.2311.16882,
title = {Optimisation-Based Multi-Modal Semantic Image Editing},
author = {Bowen Li and Yongxin Yang and Steven McDonagh and Shifeng Zhang and Petru-Daniel Tudosiu and Sarah Parisot},
journal= {arXiv preprint arXiv:2311.16882},
year = {2023}
}