中文

ForMaT:面向视觉基础的多语言 PDF 翻译数据集

计算与语言 2026-05-18 v1

摘要

我们提出了 ForMaT(格式保持多语言翻译),一个包含 15 个语言对、共 3956 份 PDF 的平行语料库,该语料库保留了为多模态机器翻译提出的原始版面元数据。为确保数据集的结构多样性,我们采用 K-Medoids 采样方法,基于 45 个几何特征进行采样,捕获嵌套表格和公式等复杂元素,从而仅关注视觉上多样的 PDF 文档。我们的评估显示,当前的机器翻译系统在空间基础和几何同步方面存在困难,常常丢失文本与其视觉上下文之间的联系。ForMaT 为开发布局感知的翻译模型提供了一个基准,这些模型整合视觉和文本上下文以实现高保真文档重建。

关键词

引用

@article{arxiv.2605.15794,
  title  = {ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation},
  author = {Michał Ciesiółka and Dawid Wiśniewski and Adrian Charkiewicz and Kamil Guttmann},
  journal= {arXiv preprint arXiv:2605.15794},
  year   = {2026}
}