OmniText:用于可控文本图像操作的无训练通用模型
计算机视觉与模式识别
2025-10-29 v1
摘要
最近的扩散基文本合成技术在通过填充插入和编辑图像中的文本方面表现显著。然而,尽管文本填充方法具有潜力,仍存在三个关键限制阻碍其在更广泛的文本图像操作(TIM)任务中的应用:(i)无法删除文本,(ii)对渲染文本样式缺乏控制,(iii)倾向于生成重复字母。为解决这些挑战,我们提出OmniText,一个无训练的通用模型,能够执行广泛的TIM任务。具体而言,我们研究交叉注意力和自注意力机制的两个关键属性,以实现文本删除并提供对文本样式和内容的控制。我们的发现表明,通过应用自注意力反转可实现文本删除,这有助于减轻模型在周围文本上聚焦的倾向,从而减少文本幻觉。此外,我们重新分配交叉注意力,因为增加特定文本标记的概率可减少文本幻觉。对于可控填充,我们在潜在优化框架中引入新型损失函数:用于提高文本渲染准确性的交叉注意力内容损失,以及用于促进样式定制的自注意力样式损失。此外,我们提出OmniText-Bench用于评估多样化TIM任务的基准数据集。它包括输入图像、带掩码的目标文本以及样式参考,涵盖文本删除、缩放、重新定位以及多种样式下的插入和编辑等多样化应用。我们的OmniText框架是首个能够执行多样化TIM任务的通用方法,相较于其他文本填充方法在多个任务和指标上实现最先进性能,同时与专家方法表现相当。
引用
@article{arxiv.2510.24093,
title = {OmniText: A Training-Free Generalist for Controllable Text-Image Manipulation},
author = {Agus Gunawan and Samuel Teodoro and Yun Chen and Soo Ye Kim and Jihyong Oh and Munchurl Kim},
journal= {arXiv preprint arXiv:2510.24093},
year = {2025}
}
备注
The first two authors contributed equally to this work. The last two authors are co-corresponding authors