AnyRefill: 一个统一的、数据高效的左提示引导视觉任务框架
计算机视觉与模式识别
2025-02-19 v2
摘要
在本文中,我们提出了一种新颖的左提示引导(LPG)范式,以应对多样化的基于参考的视觉任务。借鉴人类的创造性过程,我们使用左右拼接公式重新表述这些任务以构建上下文输入。在此基础上,我们提出 AnyRefill,它是 LeftRefill 的扩展,能够有效地将文本到图像(T2I)模型适配到各种视觉任务。AnyRefill 利用基于扩散变换器(DiT)架构的先进 T2I 模型的修复先验,并纳入灵活组件以增强其能力。通过将任务特定的 LoRA 与拼接输入相结合,AnyRefill 在多样化任务中释放其潜力,包括条件生成、视觉感知和图像编辑,而无需额外的视觉编码器。同时,AnyRefill 展现出显著的数据效率,仅需最少的任务特定微调即可保持高生成性能。通过广泛的消融研究,我们证明 AnyRefill 优于其他图像条件注入方法,并在与最先进的开源方法相比时取得了具有竞争力的结果。值得注意的是,AnyRefill 即使在具有挑战性的场景中也能提供与先进商业工具(如 IC-Light 和 SeedEdit)相当的结果。在多样化任务上的全面实验和消融研究验证了所提出的简单而有效的 LPG 公式的强大生成能力,确立了 AnyRefill 作为基于参考的视觉任务的统一、高数据效率解决方案的地位。
引用
@article{arxiv.2502.11158,
title = {AnyRefill: A Unified, Data-Efficient Framework for Left-Prompt-Guided Vision Tasks},
author = {Ming Xie and Chenjie Cao and Yunuo Cai and Xiangyang Xue and Yu-Gang Jiang and Yanwei Fu},
journal= {arXiv preprint arXiv:2502.11158},
year = {2025}
}
备注
19 pages, submitted to TPAMI