CharaConsist:面向细粒度一致字符生成
计算机视觉与模式识别
2025-07-16 v1
摘要
在文本到图像生成中,保持一致性的生成同一身份的系列内容对于实际应用至关重要。尽管已有一些工作探索了训练无关的方法来增强生成主体的一致性,但我们注意到这些方法存在以下问题。首先,它们无法维持一致的背景细节,这限制了其适用性。此外,当前景人物发生显著的运动变化时,身份和服装细节的不一致性就会变得明显。为解决这些问题,我们提出了 CharaConsist,采用点跟踪注意力和自适应 token 合并,并实现前景和背景的解耦控制。CharaConsist 实现了前景和背景的细粒度一致性,支持在固定场景中连续生成单个人物,或在不同场景中离散生成。此外,CharaConsist 是首个针对文本到图像 DiT 模型设计的一致生成方法。其在保持细粒度一致性方面的能力,结合了最新基础模型的更大容量,使其能够产生高质量的视觉输出,拓宽了其在更广泛实际场景中的适用性。该源代码已发布于 https://github.com/Murray-Wang/CharaConsist
引用
@article{arxiv.2507.11533,
title = {CharaConsist: Fine-Grained Consistent Character Generation},
author = {Mengyu Wang and Henghui Ding and Jianing Peng and Yao Zhao and Yunpeng Chen and Yunchao Wei},
journal= {arXiv preprint arXiv:2507.11533},
year = {2025}
}
备注
ICCV 2025 accepted paper, project page: https://murray-wang.github.io/CharaConsist/