中文

扩散模型中属性操控的全能滑块

计算机视觉与模式识别 2026-03-20 v3

摘要

文本到图像(T2I)扩散模型在生成高质量图像方面取得了显著进展。然而,逐步操控生成图像的某些属性以满足用户期望仍然具有挑战性,特别是对于内容丰富的图像(如人脸)。一些研究尝试通过训练滑块模块来解决此问题。然而,这些方法遵循**一对一**的方式,即为每个属性训练一个独立的滑块,当引入新属性时需要额外训练。这不仅导致滑块参数的冗余积累,还限制了实际应用的灵活性和属性操控的可扩展性。为了解决这些问题,我们引入了**全能滑块**(All-in-One Slider),一种轻量级模块,将文本嵌入空间分解为稀疏且语义上有意义的属性方向。一旦训练完成,它即可作为通用滑块,实现对各种属性的可解释且精细的连续控制。此外,通过组合所学的方向,All-in-One Slider支持多个属性的组合以及对未见属性(例如种族和名人)的零样本操控。广泛的实验结果表明,我们的方法实现了准确且可扩展的属性操控,相较于先前方法取得了显著的改进。此外,我们的方法可以扩展到与反转框架集成,用于对真实图像执行属性操控,拓宽了其在各种实际场景中的应用。该代码已在[我们的项目](https://github.com/ywxsuperstar/ksaedit)页面上提供。

关键词

引用

@article{arxiv.2508.19195,
  title  = {All-in-One Slider for Attribute Manipulation in Diffusion Models},
  author = {Weixin Ye and Hongguang Zhu and Wei Wang and Yahui Liu and Mengyu Wang and Xuecheng Nie},
  journal= {arXiv preprint arXiv:2508.19195},
  year   = {2026}
}

备注

accepted by CVPR 2026