从竞争到合作:基于文本引导的无训练合作图像编辑
计算机视觉与模式识别
2026-04-20 v1
摘要
文本引导图像编辑是现代多媒体内容创建中的关键任务,训练无需额外优化的训练自由方法取得了显著进展。尽管近期进展显著,但现有方法通常受限于竞争范式,即编辑和重建分支分别由各自目标驱动,以最大化与目标和源提示词的对齐。对抗策略由于分支之间缺乏协调,导致语义冲突和不可预测的结果。为克服这些问题,我们提出了合作训练无需图像编辑框架(CoEdit),该框架将注意力控制从竞争转向合作协商,实现在空间和时间维度上的编辑和谐。空间上,CoEdit引入双熵注意力操控,该方法量化分支之间方向熵相互作用,将注意力控制重新表述为和谐最大化问题,从而提高可编辑区域和可保留区域的局部化。时间上,我们提出了熵潜在细化机制,用于动态调整潜在表示,最小化累积的编辑误差,确保在去噪轨迹中一致的语义过渡。此外,我们提出了忠诚度受约束编辑评分,该复合度量联合评估语义编辑和背景忠诚度。大量实验在标准基准上表明,CoEdit在编辑质量和结构保持方面均实现卓越性能,通过更有效地实现视觉和文本模式之间的相互作用,增强了多媒体信息的利用。代码将在 https://github.com/JinhaoShen/CoEdit 提供。
引用
@article{arxiv.2604.15948,
title = {From Competition to Coopetition: Coopetitive Training-Free Image Editing Based on Text Guidance},
author = {Jinhao Shen and Haoqian Du and Xulu Zhang and Xiao-Yong Wei and Qing Li},
journal= {arXiv preprint arXiv:2604.15948},
year = {2026}
}