中文

SDS KoPub VDR:面向韩国公共文件的视觉文档检索基准数据集

计算与语言 2025-11-11 v2

摘要

现有视觉文档检索(VDR)基准大量忽视非英语语言以及官方出版物的结构复杂性。为弥合这一差距,我们引入 SDS KoPub VDR,这是首个大规模、公开的韩国公共文件检索与理解基准。该基准基于 361 个真实文档构建,包括 256 个 KOGL Type 1 许可证文件以及来自官方法律门户的 105 个文件,涵盖表格、图表及多列布局等复杂视觉元素。为建立可靠的评估集,我们构建了 600 组查询-页面-答案三元组。这些三元组最初使用多模态模型(如 GPT-4o)生成,随后经过人工验证以确保事实准确性和上下文相关性。查询涵盖六大公共领域,并按所需推理模式分类:文本基、视觉基及跨模态。我们在两项互补任务上评估 SDS KoPub VDR:(1)文本-only 检索,(2)多模态检索,后者利用文本和视觉特征。这种双任务评估揭示了即使在最先进模型中,跨模态推理场景下的显著性能差距,尤其是在需要跨模态推理的情境下。作为基础资源,SDS KoPub VDR 实现了严谨且细粒度的评估,为推动现实文档智能领域的多模态 AI 提供了路线图。数据集已提供于 https://huggingface.co/datasets/SamsungSDS-Research/SDS-KoPub-VDR-Benchmark。

关键词

引用

@article{arxiv.2511.04910,
  title  = {SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents},
  author = {Jaehoon Lee and Sohyun Kim and Wanggeun Park and Geon Lee and Seungkyung Kim and Minyoung Lee},
  journal= {arXiv preprint arXiv:2511.04910},
  year   = {2025}
}

备注

27 pages, 15 figures, 6 tables