DeepJSONEval:面向大语言模型的复杂嵌套 JSON 数据挖掘基准测试
人工智能
2025-10-01 v1 计算与语言
摘要
互联网充斥着低密度、高冗余的信息,如社交媒体评论、重复的新闻和冗长的讨论,这使得高效提取有价值的见解变得困难。多层嵌套的 JSON 结构通过将此类信息压缩为语义丰富的层次化表示提供了一种有效的解决方案,其将数据组织为键值对、数组和嵌套对象,从而保留上下文关系并实现高效的存储、检索和语义查询。例如,在新闻聚合中,JSON 对象可以按层次结构嵌套文章的元数据(标题、作者、日期)、内容(文本、多媒体)和多媒体信息(多媒体类型、说明文字)。大语言模型(LLM)通过解析非结构化文本并直接将结构化结果输出到复杂的 JSON 模式中,在网络数据挖掘中发挥着变革性作用。然而,当前用于评估 LLM 的 JSON 输出能力的基准过度强调纯 JSON 生成,而不是评估数据理解和提取能力,这一局限性缺乏与实际网络数据挖掘任务的相关性。为了解决这一问题,我们引入了 DeepJSONEval,这是一种新颖的基准测试,包含 2100 个具有深度嵌套结构的多领域实例,并按难度进行分类。实验表明,LLM 在处理此类复杂性时存在显著的性能差距。我们的基准测试和数据集已开源,以推进结构化 JSON 生成的研究。(https://github.com/GTS-AI-Infra-Lab-SotaS/DeepJSONEval)。
引用
@article{arxiv.2509.25922,
title = {DeepJSONEval: Benchmarking Complex Nested JSON Data Mining for Large Language Models},
author = {Zhicheng Zhou and Jing Li and Suming Qiu and Junjie Huang and Linyuan Qiu and Zhijie Sun},
journal= {arXiv preprint arXiv:2509.25922},
year = {2025}
}