中文

匈牙利语合成文档问答

计算机视觉与模式识别 2025-05-30 v1 人工智能 计算与语言

摘要

现代视觉语言模型(VLMs)在英文文档视觉问答(VQA)中已达到接近饱和的准确率。然而,由于缺乏合适的训练和评估数据,该任务在低资源语言中仍然具有挑战性。在本文中,我们以匈牙利语(互联网上资源量大约排名第 17 的语言)为重点,提出了策划此类数据集的可扩展方法。具体而言,我们提出了 HuDocVQA 和 HuDocVQA-manual,现代 VLMs 在这些文档 VQA 数据集上的表现显著逊于英文 DocVQA。HuDocVQA-manual 是一个基于 Common Crawl 中匈牙利语文档的小型人工策划数据集,而 HuDocVQA 是来自同一来源的较大规模合成生成 VQA 数据集。我们对 HuDocVQA 应用了多轮质量过滤和去重,以使该数据集达到人类水平的质量。我们还提出了 HuCCPDF,这是一个包含来自匈牙利语 Common Crawl PDF 的 117k 页面及其转录的数据集,可用于训练匈牙利语 OCR 模型。为了验证我们数据集的质量,我们展示了在这些数据集的混合上进行微调可以将 Llama 3.2 11B Instruct 在 HuDocVQA 上的准确率提高 +7.2%。我们的数据集和代码将向公众发布,以促进多语言 DocVQA 的进一步研究。

关键词

引用

@article{arxiv.2505.23008,
  title  = {Synthetic Document Question Answering in Hungarian},
  author = {Jonathan Li and Zoltan Csaki and Nidhi Hiremath and Etash Guha and Fenglu Hong and Edward Ma and Urmish Thakker},
  journal= {arXiv preprint arXiv:2505.23008},
  year   = {2025}
}