中文

结构化输出基准测试:面向大型语言模型的多源结构化输出质量评估基准

计算与语言 2026-04-29 v1 人工智能

摘要

大型语言模型正在越来越多地用于从非结构化和准结构化来源中提取结构化数据:解析发票、医疗记录和将 PDF 文档转换为数据库条目。然而,现有的结构化输出生成基准要么仅关注模式合规性,要么在单一源域中评估值正确性。我们引入了 SOB(结构化输出基准),是一个跨越三种源模态的基准:本地文本、图像和音频对话。所有模型都会接收一个文本归一化的 their context 表示,无论源模态如何;这种刻意的设计将结构化输出能力从 raw vision 或 speech-processing quality 中隔离,确保公平、源无关的比较。 our 基准包括 5,000 条文本评估记录,源自 multi-hop QA,从 25,091 条记录的完整语料库中抽取;209 条图像记录来自 OCR 处理的 PDF,涵盖七种文档类型,包括多列布局、密集表格、扫描的历史文档、小字文本和数学排版;以及 115 条音频记录来自 AMI 语料库。每条记录将一个自然语言问题与一个模型必须遵循的 JSON 模式配对,并提供一个经过验证的 ground-truth answer。我们评估了 21 个前沿和开源模型,跨越三个源域和七个指标。 our 结果显示出一致模式:模型在模式合规性方面几乎完美,但最佳 Value Accuracy(以 exact leaf-value match 测量)仅在文本上达到 83.0%,在图像上达到 67.2%,在音频上仅达到 23.7%,其中更长的上下文使得提取在难度上显著增加。我们发布了数据集、评估管道和所有相关代码。

关键词

引用

@article{arxiv.2604.25359,
  title  = {The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models},
  author = {Abhinav Kumar Singh and Harsha Vardhan Khurdula and Yoeven D Khemlani and Vineet Agarwal},
  journal= {arXiv preprint arXiv:2604.25359},
  year   = {2026}
}

备注

19 pages, 4 figures, 11 tables, submitted to NeurIPS 2026