通过注意力分析探索语言模型用于表格问答的鲁棒性
计算与语言
2025-08-27 v4 人工智能
摘要
大型语言模型(LLMs)已展示在各种非结构化文本理解任务中卓越的性能,也表现出在不特定训练的情况下处理表格(结构化)理解任务的能力。基于对LLMs用于表格任务的早期研究,我们探讨了准则学习(in-context learning, ICL)、模型规模、指令调优以及领域偏差如何影响表格问答(Tabular QA, TQA)鲁棒性,通过在多样化的增强和扰动下测试LLMs,应用于多样化领域:基于维基百科的WTQ、金融TAT-QA以及科学SCITAB。尽管指令调优和更大、更新的LLMs提供了更强、更具鲁棒性的TQA性能,但WTQ上的数据污染和可靠性问题仍未得到解决。通过深入的注意力分析,我们揭示了注意力分布随扰动变化与性能下降之间的强相关性,敏感性在模型的中间层最为显著。我们强调需要改进可解释的方法,以开发更可靠的LLMs用于表格理解。基于这些发现,我们主张发展结构感知的自注意力机制和领域自适应处理技术,以提高LLMs在表格数据上的透明度、泛化性和实际可靠性。
引用
@article{arxiv.2406.12719,
title = {Exploring the Robustness of Language Models for Tabular Question Answering via Attention Analysis},
author = {Kushal Raj Bhandari and Sixue Xing and Soham Dan and Jianxi Gao},
journal= {arXiv preprint arXiv:2406.12719},
year = {2025}
}
备注
Accepted TMLR 2025