RefineAnything:面向完美局部细节的多模态区域特定精细化模型
计算机视觉与模式识别
2026-04-09 v1
摘要
我们提出区域特定图像精细化作为一种专门的问题设置:给定输入图像和用户指定的区域(例如,草稿掩码或边界框),目标是在保持所有非编辑像素严格不变的前提下,恢复局部细微细节。尽管图像生成领域取得了快速进展,现代模型仍经常出现局部细节坍塌(例如,变形的文本、标志和细小结构)。现有的指令驱动编辑模型强调粗粒度语义编辑,往往忽视细微局部缺陷,或在区域感兴趣仅占固定分辨率输入中很小一部分时不小心改变背景。我们提出 RefineAnything,一种基于多模态扩散的精细化模型,支持基于参考和无参考的精细化。基于对 crop-and-resize 在固定 VAE 输入分辨率下对局部重建显著性提高的反直觉观察,我们提出 Focus-and-Refine,一种区域聚焦精细化-粘贴策略,通过重新分配目标区域的分辨率预算来提高精细化效果和效率,而混合掩码粘贴确保严格的背景保留。我们进一步引入边界感知边界一致性损失以减少接缝伪影并提高粘贴的自然性。为支持这一新问题设置,我们构建了 Refine-30K(包含 20K 个基于参考的样本和 10K 个无参考样本)并引入 RefineEval,一个评估编辑区域忠实度和背景一致性的基准。在 RefineEval 上,RefineAnything 相较于竞争基线实现显著改进,几乎实现完美的背景保留,为高精度局部精细化提供了实用解决方案。项目页面:https://limuloo.github.io/RefineAnything/。
引用
@article{arxiv.2604.06870,
title = {RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details},
author = {Dewei Zhou and You Li and Zongxin Yang and Yi Yang},
journal= {arXiv preprint arXiv:2604.06870},
year = {2026}
}
备注
18 pages