中文

ScrapeGraphAI-100k:面向模式约束LLM生成的数据集

信息检索 2026-05-11 v2 人工智能 计算与语言

摘要

遵循指定JSON模式的输出构成了现代大语言模型中工具使用、结构化抽取和知识库构建的核心任务。尽管此任务至关重要,但公开数据集仍较小、合成或仅文本,且很少将真实页面内容与实际中使用的提示和模式配对。我们引入ScrapeGraphAI-100k,经由2025年第二/第三季度的opt-in ScrapeGraphAI遥测收集的93,695个模式约束抽取事件,经去重和按模式平衡,来自900万原始事件。该语料库覆盖18,000多个唯一模式,跨15种命名语言外加长尾Other类别,英语和繁体中文覆盖了检测内容的88%。每个实例均将Markdown转换后的页面内容与提示、模式、LLM响应以及每个示例的jsonschema-rs结构一致性标签配对(语义正确性不在范围内,原始HTML在v1.0版本后暂缓)。我们刻画了该语料库中的结构多样性,识别出随模式复杂度增长的尖锐失效阈值。作为案例研究,一个17亿参数的模型在该数据上微调后,几乎跟随其GPT-5-nano教师的输出分布,尽管仍在模式合规性方面落后于30B-A3B参考模型(33亿活跃参数)。我们将此蒸馏结果作为 grounding schema-constrained generation in real practitioner workloads at scale 以支持训练和基准测试的初步证据,而此类训练和基准测试是此前合成或仅文本语料库无法实现的。

关键词

引用

@article{arxiv.2602.15189,
  title  = {ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation},
  author = {William Brach and Francesco Zuppichini and Marco Vinciguerra and Lorenzo Padoan},
  journal= {arXiv preprint arXiv:2602.15189},
  year   = {2026}
}