面向多语言图像翻译的 U-Net 与 Transformer 流程
机器学习
2025-10-28 v1 计算与语言
计算机视觉与模式识别
摘要
本文提出了一个端到端的多语言翻译管道,集成用于文本检测的自定义 U-Net、Tesseract 引擎用于文本识别,以及从头开始构建的序列到序列 (Seq2Seq) Transformer 用于神经机器翻译 (NMT)。我们的 approach 首先利用在合成数据集上训练的 U-Net 模型准确分割和检测图像中的文本区域。然后,这些检测到的区域由 Tesseract 处理以提取 source text。该提取文本输入到在跨越 5 种语言的多语言平行语料库上训练的自定义 Transformer 模型中。不同于依赖单一预训练模型的系统,our architecture 强调完全定制和可适应性。该系统在文本检测准确率、文本识别质量以及通过 BLEU 分数评估的翻译性能方面得到评估。完整的管道展示了有前景的结果,验证了用于直接从图像翻译文本的定制系统的可行性。
关键词
引用
@article{arxiv.2510.23554,
title = {A U-Net and Transformer Pipeline for Multilingual Image Translation},
author = {Siddharth Sahay and Radhika Agarwal},
journal= {arXiv preprint arXiv:2510.23554},
year = {2025}
}
备注
6 pages, 3 figures, 5 tables, and 2 algorithms. Prepared in IEEE double-column format