中文

PATIMT-Bench:面向大型视觉语言模型的位置感知文本图像机器翻译多场景基准

计算机视觉与模式识别 2025-09-17 v1 人工智能

摘要

文本图像机器翻译(TIMT)旨在将图像中嵌入的文本翻译为另一种语言。当前的 TIMT 研究主要集中在为图像中的所有文本提供翻译,却忽略了提供边界框且覆盖的场景有限。在本工作中,我们将传统 TIMT 扩展为位置感知 TIMT(PATIMT),旨在支持细粒度且保留布局的翻译,该任务具有巨大的实用价值但很大程度上尚未被探索。此任务包含两个关键子任务:特定区域翻译和带定位的全图翻译。为了支持现有模型处理 PATIMT 并进行公平评估,我们构建了 PATIMT 基准(PATIMTBench),其包含 10 种多样的真实世界场景。具体而言,我们引入了自适应图像 OCR 优化流水线,该流水线根据场景自适应选择合适的 OCR 工具,并优化富文本图像的结果。为确保评估的可靠性,我们进一步构建了一个测试集,其中包含 1,200 个由人类专家手动标注和审查的高质量实例。在我们的数据上进行微调后,紧凑的大型视觉语言模型(LVLMs)在两个子任务上均取得了最先进的性能。实验结果还突显了我们训练数据的可扩展性和泛化能力。

关键词

引用

@article{arxiv.2509.12278,
  title  = {PATIMT-Bench: A Multi-Scenario Benchmark for Position-Aware Text Image Machine Translation in Large Vision-Language Models},
  author = {Wanru Zhuang and Wenbo Li and Zhibin Lan and Xu Han and Peng Li and Jinsong Su},
  journal= {arXiv preprint arXiv:2509.12278},
  year   = {2025}
}