利用 PDF 数据提升日语大型多模态模型性能
计算与语言
2026-01-09 v2 人工智能
计算机视觉与模式识别
摘要
大型多模态模型(LMMs)在英语方面已展现出强大的性能,但其在日语方面的效果仍受限,主要由于缺乏高质量训练数据。当前的日语 LMMs 常依赖翻译后的英语数据集,限制了其捕捉日本特有文化知识的能力。为此,我们探索将日语 PDF 数据作为训练资源的潜力,该领域目前仍被大幅未被利用。我们引入了一个全自动流水线,利用预训练模型通过布局分析、OCR 和视觉语言配对从 PDF 中提取图像-文本对,无需人工标注。此外,我们从提取的图像-文本对构建指令数据,以丰富训练数据。为评估 PDF 数据的有效性,我们训练了日语 LMMs 并在日语 LMM 基准测试中进行评估。结果显示,在 Heron-Bench 上实现了 2.1%至 13.8% 的显著性提升。进一步分析表明,PDF 数据对模型规模和语言模型等 various factors 产生深远影响,强化了其作为日语 LMMs 宝贵多模态资源的价值。
引用
@article{arxiv.2502.14778,
title = {Harnessing PDF Data for Improving Japanese Large Multimodal Models},
author = {Jeonghun Baek and Akiko Aizawa and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2502.14778},
year = {2026}
}
备注
Accepted to ACL2025 Findings. Code: https://github.com/ku21fan/PDF-JLMM