中文

表格扭曲下大语言模型鲁棒性的实证研究

人工智能 2026-01-09 v1

摘要

我们研究当规范表示中的表格数据受到语义和结构扭曲时,大语言模型(LLM)是如何失效的。我们的研究结果表明,LLM 缺乏检测和纠正表格表示中细微扭曲的固有能力。只有通过系统提示词提供显式先验时,模型才会部分调整其推理策略并纠正某些扭曲,尽管并不一致或完整。为了研究这一现象,我们引入了一个由专家精心筛选的小型数据集,该数据集在表格问答(TQA)任务上显式评估 LLM,要求在分析之前进行额外的纠错步骤。我们的结果揭示了 LLM 在扭曲下摄取和解释表格信息的方式存在系统性差异,即使是如 GPT-5.2 这样的 SoTA 模型在扭曲下也表现出至少 22% 的准确率下降。这些发现为未来的研究提出了重要问题,特别是关于模型何时以及如何在不依赖显式提示或表格数据预处理的情况下,自主决定重新对齐表格输入,类似于人类行为。

关键词

引用

@article{arxiv.2601.05009,
  title  = {An Empirical Investigation of Robustness in Large Language Models under Tabular Distortions},
  author = {Avik Dutta and Harshit Nigam and Hosein Hasanbeig and Arjun Radhakrishna and Sumit Gulwani},
  journal= {arXiv preprint arXiv:2601.05009},
  year   = {2026}
}

备注

4 pages, 1 figure, 1 table