EditIDv2:面向文本到图像生成的数据润滑ID特征整合与可编辑ID定制
计算机视觉与模式识别
2025-09-09 v1
摘要
我们提出了EditIDv2,一种专门针对高复杂度叙事场景和长文本输入的无调优解决方案。现有的角色编辑方法在简单提示下表现良好,但在面对包含多层语义、时间逻辑和复杂上下文关系的长文本叙事时,常出现编辑能力退化、语义理解偏差和身份一致性崩溃等问题。在EditID中,我们分析了ID整合模块对可编辑性的影响。在EditIDv2中,我们进一步探索并解决了ID特征整合模块的影响。EditIDv2的核心是讨论在最小数据润滑下可编辑性注入的问题。通过对PerceiverAttention的精巧分解、ID损失和扩散模型的联合动态训练以及整合模块的离线融合策略,我们在仅使用少量数据润滑的条件下,在复杂叙事环境中实现了深度多层语义编辑,同时保持了身份一致性。这满足了长提示和高质量图像生成的需求,并在IBench评估中取得了优异结果。
引用
@article{arxiv.2509.05659,
title = {EditIDv2: Editable ID Customization with Data-Lubricated ID Feature Integration for Text-to-Image Generation},
author = {Guandong Li and Zhaobin Chu},
journal= {arXiv preprint arXiv:2509.05659},
year = {2025}
}