DynASyn:多主体个性化实现动态动作合成
计算机视觉与模式识别
2025-03-25 v1 人工智能
摘要
近期文本到图像扩散模型的进展推动了关于主体个性化(即对参考图像中主体的定制化图像合成)的研究。尽管现有个性化方法能够改变主体的位置或同时个性化多个主体,但它们往往难以修改主体的行为或其动态相互作用。这种困难可归因于对参考图像的过度拟合,若仅提供单张参考图像则问题更为严重。我们提出DynASyn,一种有效的单参考图像多主体个性化方法,以解决上述挑战。DynASyn通过将基于概念的先验与主体外观和动作对齐,保留了主体身份信息于个性化过程中。这通过对主体标记与图像之间的注意力图进行基于概念的正则化来实现。此外,我们提出基于概念的提示-图像增强,以实现身份保留与动作多样性之间的更佳权衡。我们采用基于SDE的方法,通过增强提示生成多样化的外观和动作,同时在增强图像中保持身份一致性。实验表明,DynASyn能够合成主体在新情境下的高逼真图像,并实现主体与周围环境的动态相互作用,显著优于基线方法在定量和定性方面的表现。
引用
@article{arxiv.2503.17728,
title = {DynASyn: Multi-Subject Personalization Enabling Dynamic Action Synthesis},
author = {Yongjin Choi and Chanhun Park and Seung Jun Baek},
journal= {arXiv preprint arXiv:2503.17728},
year = {2025}
}
备注
Accepted at AAAI 2025