NeedleInATable:探索大语言模型面向长结构表格的长情境能力
计算与语言
2025-10-29 v4
摘要
处理结构化表格数据,尤其是大型且冗长的表格,是大语言模型( LLMs)的一个基本且具有挑战性的任务。然而,现有的长情境基准如 Needle-in-a-Haystack 主要关注非结构化文本,忽略了多样化结构化表格的挑战。与此同时,之前的表格基准主要关注需要高级推理能力的下游任务,忽略了模型对单个表格单元格的底层细粒度感知,这对于实际且稳健的基于 LLM 的表格应用至关重要。为此,我们引入textsc{NeedleInATable}(NIAT),一个新的长情境表格基准,将每个表格单元格视为一个 "needle",要求模型根据单元格位置或查找问题提取目标单元格。我们对各种 LLMs 和多模态 LLMs 进行全面评估,发现热门下游表格任务与更简单 NIAT 任务之间存在显著的性能差距,这表明它们可能依赖于数据特定的相关性或捷径来获得更好的基准结果,但缺乏对结构化表格的真正稳健的长情境理解能力。此外,我们证明使用合成 NIAT 训练数据可有效提高 NIAT 任务以及下游表格任务的性能,这验证了 NIAT 能力对 LLMs 真正表格理解能力的重要性。
引用
@article{arxiv.2504.06560,
title = {NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables},
author = {Lanrui Wang and Mingyu Zheng and Hongyin Tang and Zheng Lin and Yanan Cao and Jingang Wang and Xunliang Cai and Weiping Wang},
journal= {arXiv preprint arXiv:2504.06560},
year = {2025}
}
备注
Accepted by NeurIPS 2025