DanceText:面向图像中可控多语言文本变换的无训练分层框架
计算机视觉与模式识别
2025-09-29 v2
摘要
我们提出了 DanceText,一个无训练框架,用于图像中的多语言文本编辑,旨在支持复杂的几何变换并实现前景与背景的无缝集成。虽然扩散生成模型在文本导向图像合成方面显示出前景,但它们往往缺乏可控性,无法在旋转、平移、缩放和扭曲等非平凡操作下保持布局一致性。为解决这些限制,DanceText 引入一种分层编辑策略,将文本与背景分离,允许在模块化且可控的方式下执行几何变换。进一步提出了深度感知模块,用于在变形后的文本与重构后的背景之间实现外观和视角的对齐,从而增强真实感和空间一致性。重要的是,DanceText 采用完全无训练的设计,通过集成预训练模块实现灵活部署,而无需针对特定任务进行微调。在 AnyWord-3M 数据集上的大量实验表明,我们的方法在视觉质量方面表现优异,尤其是在大规模和复杂变换场景下效果更为突出。代码可在 https://github.com/YuZhenyuLindy/DanceText.git 获取。
引用
@article{arxiv.2504.14108,
title = {DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images},
author = {Zhenyu Yu and Mohd Yamani Idna Idris and Hua Wang and Pei Wang and Rizwan Qureshi and Shaina Raza and Aman Chadha and Yong Xiang and Zhixiang Chen},
journal= {arXiv preprint arXiv:2504.14108},
year = {2025}
}