DIMT25@ICDAR2025:HW-TSC 基于大型视觉语言模型的端到端文档图像机器翻译系统
计算机视觉与模式识别
2025-04-25 v1 人工智能
摘要
本文介绍了华为翻译服务中心(HW-TSC)为 "End-to-End Document Image Machine Translation for Complex Layouts" 任务在第 19 届国际文档识别与分析会议(DIMT25@ICDAR2025)中提出的技术解决方案。我们利用最先进的开源大型视觉语言模型(LVLM),引入一种结合多任务学习与感知链式思考的训练框架,以开发一个全面的端到端文档翻译系统。在推理阶段,我们应用最小贝叶斯解码和后处理策略进一步提升系统的翻译能力。我们的解决方案在统一的框架中唯一性地处理 OCR 基于和 OCR-free 文档图像翻译任务。本文系统地详细介绍了训练方法、推理策略、LVLM 基础模型、训练数据、实验设置以及结果,展示了一种有效的文档图像机器翻译方法。
引用
@article{arxiv.2504.17315,
title = {DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model},
author = {Zhanglin Wu and Tengfei Song and Ning Xie and Weidong Zhang and Pengfei Li and Shuang Wu and Chong Li and Junhao Zhu and Hao Yang},
journal= {arXiv preprint arXiv:2504.17315},
year = {2025}
}
备注
7 pages, 1 figures, 2 tables