ICDAR 2025 文档图像机器翻译竞赛:面向复杂布局
计算机视觉与模式识别
2026-03-11 v1 人工智能
摘要
文档图像机器翻译 (DIMT) 旨在从一种语言翻译到另一种语言,通过联合建模文本内容和页面布局,将光学字符识别 (OCR) 和自然语言处理 (NLP) 桥接起来。DIMT 2025 挑战推进了面向复杂布局文档图像的端到端文档图像翻译,这一快速演进的多模态文档理解领域。该竞赛包含两个轨道,OCR-free 与 OCR-based,每个轨道都有针对小模型(参数不足 10 亿)和大模型(参数超过 10 亿)的两个子任务。参赛者提交统一的 DIMT 系统,可选择性地整合提供的 OCR 文本。比赛运行于 2024 年 12 月 10 日至 2025 年 4 月 20 日,共有 69 支队伍参赛,27 个有效提交。轨道 1 有 34 支队伍和 13 个有效提交,轨道 2 有 35 支队伍和 14 个有效提交。本报告中,我们介绍了挑战动机、数据集构建、任务定义、评估协议及结果概述。我们的分析表明,大模型方法为翻译复杂布局文档图像建立了有前景的新范式,并指出了未来研究的广泛机遇。
引用
@article{arxiv.2603.09392,
title = {ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts},
author = {Yaping Zhang and Yupu Liang and Zhiyang Zhang and Zhiyuan Chen and Lu Xiang and Yang Zhao and Yu Zhou and Chengqing Zong},
journal= {arXiv preprint arXiv:2603.09392},
year = {2026}
}
备注
accepted by ICDAR 2025