中文

超越孤立散点:将结构化表格构建作为深度知识提取的基准测试

计算与语言 2025-10-31 v2

摘要

随着大语言模型(LLMs)的出现,人们期望 LLMs 能够有效地从复杂的现实世界文档(如论文、报告)中提取显式信息。然而,大多数 LLMs 生成的是混乱、无序且难以追溯的段落式回答。为了弥合这一差距,我们引入了排列与组织提取基准(AOE),这是一个包含不同长度数据和文档的新型双语基准,旨在系统地评估 LLMs 理解碎片化文档并将孤立信息重构为一张有序表格的能力。与依赖固定模式和狭窄任务领域的传统文本到表格任务不同,AOE 包含跨越三个不同领域的 11 项精心设计的任务,要求模型生成针对各种输入查询量身定制的特定上下文模式。在实验中,我们评估了开源和闭源的最先进 LLMs。结果表明,即使是最先进的模型也存在显著困难。该基准测试可在 https://anonymous.4open.science/r/AOE-Benchmark/ 获取。

关键词

引用

@article{arxiv.2507.16271,
  title  = {Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction},
  author = {Tianyun Zhong and Guozhao Mo and Yanjiang Liu and Yihan Chen and Lingdi Kong and Xuanang Chen and Yaojie Lu and Hongyu Lin and Shiwei Ye and Xianpei Han and Ben He and Le Sun},
  journal= {arXiv preprint arXiv:2507.16271},
  year   = {2025}
}