中文

EditID:基于 DiT 的训练无关可编辑 ID 定制方法

计算机视觉与模式识别 2025-03-18 v1

摘要

我们提出了 EditID,一种基于 DiT 架构的训练无关方法,实现了文本到图像生成中高度可编辑的定制 ID。现有的文本到图像模型用于定制 ID 通常更关注 ID 一致性,而忽略可编辑性。通过提示词改变面部姿态、角色属性及其他特征具有挑战性。EditID 通过将文本到图像模型用于定制 ID 解构为图像生成分支和角色特征分支来解决此问题。其中,角色特征分支进一步解耦为三个模块:特征提取、特征融合和特征集成。通过引入映射特征和平移特征的组合,以及控制 ID 特征集成的强度,EditID 实现了跨网络深度局部特征的语义压缩,形成可编辑的特征空间。这使得能够在保持 ID 一致性的同时成功生成高质量的可编辑 ID 图像,在 IBench 评估中实现了优异成绩。IBench 是一个用于定制 ID 文本到图像生成领域的可编辑性评估框架,定量地表明了 EditID 卓越的性能。EditID 是首个在 DiT 架构上提出可定制 ID 可编辑性的文本到图像解决方案,满足长提示和高质量图像生成的需求。

关键词

引用

@article{arxiv.2503.12526,
  title  = {EditID: Training-Free Editable ID Customization for Text-to-Image Generation},
  author = {Guandong Li and Zhaobin Chu},
  journal= {arXiv preprint arXiv:2503.12526},
  year   = {2025}
}