通过社交上下文反馈提高个性化图像生成效果
计算机视觉与模式识别
2025-07-23 v1
摘要
个性化图像生成是指使用一个或多个主体的参考图像根据场景描述生成其图像的过程,社区对此已取得显著关注。然而,这些生成的图像存在三个主要局限性——复杂活动(如<man, pushing, motorcycle>)未能正确生成,导致人体姿势错误;参考人体身份未被保留;生成的人体凝视模式不自然/与场景描述不一致。为克服这些局限性,本文提出通过反馈式微调现有个性化生成方法来实现上述目标,其中利用姿态、人体-物体交互、人脸识别和人体凝视点估计等最先进检测器来细化扩散模型。我们还提出根据信号是低级(如人体姿态)还是高级(如凝视点)的不同,进行基于时间步的不同反馈模块的逐步引入。本方法生成的图像在生成交互、人脸身份和图像质量方面均优于三个基准数据集。
引用
@article{arxiv.2507.16095,
title = {Improving Personalized Image Generation through Social Context Feedback},
author = {Parul Gupta and Abhinav Dhall and Thanh-Toan Do},
journal= {arXiv preprint arXiv:2507.16095},
year = {2025}
}