中文

确保图像翻译一致性

计算与语言 2024-12-25 v1

摘要

图像内机器翻译任务涉及翻译嵌入在图像中的文本,翻译结果以图像格式呈现。尽管该任务在诸多场景中具有广泛应用前景,如电影海报翻译和日常场景图像翻译,但现有方法常常忽视了整个过程中的一致性问题。我们提出需维持两种类型的一致性:翻译一致性和图像生成一致性。前者要求在翻译时融入图像信息,后者则要求保持文本图像样式与原图风格的一致性,以确保背景完整。为此,我们引入一种新型双阶段框架,称为 HCIIT(High-Consistency In-Image Translation),其中第一阶段使用多模态多语言大型语言模型进行文本图像翻译,第二阶段使用扩散模型进行图像填充。利用链式思维学习增强模型在翻译时融入图像信息的能力。随后,训练用于风格一致文本图像生成的扩散模型,确保图像中文本风格统一并保留背景细节。我们编制了由 40 万组风格一致的伪文本图像对组成的数据集用于模型训练。在所选测试集和真实图像测试集上的结果表明,我们的框架在确保一致性和生成高质量翻译图像方面均效果显著。

关键词

引用

@article{arxiv.2412.18139,
  title  = {Ensuring Consistency for In-Image Translation},
  author = {Chengpeng Fu and Xiaocheng Feng and Yichong Huang and Wenshuai Huo and Baohang Li and Zhirui Zhang and Yunfei Lu and Dandan Tu and Duyu Tang and Hui Wang and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2412.18139},
  year   = {2024}
}