中文

AssetDropper:基于奖励驱动优化的扩散模型资产提取

计算机视觉与模式识别 2025-06-10 v1

摘要

最近的生成模型研究主要聚焦于创建产品就绪的视觉输出;然而,设计师往往更倾向于获取标准化的资产库,而这一领域尚未受到生成能力的显著提升。虽然开放世界场景为设计师提供了丰富的原始材料,但高效提取高质量、标准化资产仍然是一个挑战。为此,我们引入 AssetDropper,这是第一个旨在从参考图像中提取资产的框架,为艺术家提供开放世界资产调色板。我们的模型擅长从输入图像中提取所选主体的正视图,能够有效处理诸如视角畸变和主体遮挡等复杂情景。我们建立了一个包含 20 多万张图像-主体对的合成数据集和一个包含数千个样本的真实世界基准进行评估,促进了下游任务的后续研究。此外,为确保提取的资产与图像提示保持一致,我们采用预训练奖励模型实现反馈闭环。我们设计的奖励模型执行反向任务,即将提取的资产粘贴回参考来源,以协助训练额外的一致性并减轻幻觉。广泛的实验表明,随着奖励驱动优化的帮助,AssetDropper 在资产提取任务上实现了最新的 SOTA 结果。项目页面:AssetDropper.github.io。

关键词

引用

@article{arxiv.2506.07738,
  title  = {AssetDropper: Asset Extraction via Diffusion Models with Reward-Driven Optimization},
  author = {Lanjiong Li and Guanhua Zhao and Lingting Zhu and Zeyu Cai and Lequan Yu and Jian Zhang and Zeyu Wang},
  journal= {arXiv preprint arXiv:2506.07738},
  year   = {2025}
}

备注

SIGGRAPH 2025. 11 pages, 12 figures