AnyTrans:利用大规模模型翻译图像中的任意文本
计算机视觉与模式识别
2024-06-18 v1 人工智能
摘要
本文介绍了 AnyTrans,一个用于“翻译图像中任意文本”(TATI)任务的全面框架,该任务包括图像内的多语言文本翻译和文本融合。我们的框架利用大规模模型(如大型语言模型(LLM)和文本引导扩散模型)的优势,在翻译过程中融入来自文本和视觉元素的上下文线索。LLM 的少样本学习能力允许通过考虑整体上下文来翻译碎片化文本。同时,扩散模型的高级修复和编辑能力使得能够将翻译后的文本无缝融合到原始图像中,同时保持其风格和真实感。此外,我们的框架可以完全使用开源模型构建,无需训练,因此具有高度的可访问性和易于扩展性。为了推动 TATI 任务的进步,我们精心整理了一个名为 MTIT6 的测试数据集,该数据集包含来自六种语言对的多语言文本图像翻译数据。
引用
@article{arxiv.2406.11432,
title = {AnyTrans: Translate AnyText in the Image with Large Scale Models},
author = {Zhipeng Qian and Pei Zhang and Baosong Yang and Kai Fan and Yiwei Ma and Derek F. Wong and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2406.11432},
year = {2024}
}