二维位置编码提升大型语言模型对表格理解的能力
计算与语言
2024-10-21 v3
摘要
表格在各个领域广泛用于简洁地表示结构化信息。赋予大型语言模型(LLM)对表格数据的推理能力是当前活跃的研究方向。然而,由于典型的LLM仅支持一维(1D)输入,现有方法常将二维(2D)表格结构展平为标记序列,这会严重破坏空间关系,导致不可避免的关键上下文信息丢失。本文首先通过两个精心设计的代理任务,实证地证明了此类展平操作对LLM捕获表格空间信息的性能产生严重负面影响。随后,我们提出一种简单而有效的方法,称为二维表格位置编码(2D-TPE),以解决这一挑战。2D-TPE使每个注意力头能够动态选择上下文中标记的排列顺序进行注意,其中每种排列代表一种不同的表格遍历模式,如按列或按行遍历。2D-TPE有效缓解了丢失关键空间信息的风险,同时保持计算效率,从而更好地保留表格结构。广泛的实验表明,2D-TPE在五个基准任务上均优于强大 baselines,凸显了保持表格结构对于准确表格理解的重要性。更全面的分析进一步显示,2D-TPE在大型表格上的可扩展性显著优于 baselines。
引用
@article{arxiv.2409.19700,
title = {2D-TPE: Two-Dimensional Positional Encoding Enhances Table Understanding for Large Language Models},
author = {Jia-Nan Li and Jian Guan and Wei Wu and Zhengtao Yu and Rui Yan},
journal= {arXiv preprint arXiv:2409.19700},
year = {2024}
}