中文

PhyCustom:面向文本到图像生成的真实物理定制

计算机视觉与模式识别 2025-12-03 v1

摘要

近期基于扩散的文本到图像定制方法在理解具体概念以控制生成过程方面取得了显著进展,如风格与形状。然而,少数研究深入探索了对真实且具挑战性的物理概念进行定制。当前方法的核心局限在于训练期间未显式引入物理知识。即使输入文本提示中出现与物理相关的词汇,我们的实验始终表明,这些方法难以准确反映相应物理属性于生成结果之中。本文提出 PhyCustom,一个包含两个新型正则化损失的精调框架,以激活扩散模型执行物理定制。具体而言,所提出的等距损失旨在激活扩散模型学习物理概念,解耦损失有助于消除独立概念的混合学习。我们在多样化数据集上进行实验,基准结果表明 PhyCustom 在物理定制方面在定量与定性均优于先前的最先进方法和流行方法。

关键词

引用

@article{arxiv.2512.02794,
  title  = {PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation},
  author = {Fan Wu and Cheng Chen and Zhoujie Fu and Jiacheng Wei and Yi Xu and Deheng Ye and Guosheng Lin},
  journal= {arXiv preprint arXiv:2512.02794},
  year   = {2025}
}

备注

codes:https://github.com/wufan-cse/PhyCustom