一任务值一词:利用任务提示学习高质量多功能图像修复
计算机视觉与模式识别
2024-07-24 v4
摘要
推进图像修复具有挑战性,因为它需要为各种意图填充用户指定区域,例如背景填充和对象合成。现有方法侧重于使用文本描述进行上下文感知填充或对象合成。然而,由于训练策略不同,同时实现这两项任务具有挑战性。为了克服这一挑战,我们引入了 PowerPaint,这是第一个在多项修复任务中表现出色的高质量多功能修复模型。首先,我们引入可学习的任务提示以及量身定制的微调策略,以明确引导模型关注不同的修复目标。这使得 PowerPaint 能够通过利用不同的任务提示来完成各种修复任务,从而实现 SOTA 性能。其次,我们展示了 PowerPaint 中任务提示的多功能性,展示了其作为对象移除的负提示的有效性。此外,我们利用提示插值技术实现可控的形状引导对象修复,增强了模型在形状引导应用中的适用性。最后,我们进行了广泛的实验和应用以验证 PowerPaint 的有效性。我们在项目页面发布代码和模型:https://powerpaint.github.io/。
引用
@article{arxiv.2312.03594,
title = {A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting},
author = {Junhao Zhuang and Yanhong Zeng and Wenran Liu and Chun Yuan and Kai Chen},
journal= {arXiv preprint arXiv:2312.03594},
year = {2024}
}
备注
Project page with code: https://powerpaint.github.io/