中文

表格实体消歧中的 LLM 评估

计算与语言 2024-11-04 v3 人工智能

摘要

表格是信息的关键容器,但理解其含义可能具有挑战性。多年来,基于深度学习的数据驱动方法日益增多,越来越多地与基于启发式的方法相结合。近期,大型语言模型 (LLM) 的出现导致了一种新的表格注释方法类别。然而,这些方法在统一的基准上进行评估,使得评估和比较困难。本工作提出了对四种STI SOTA 方法的广泛评估:Alligator(此前称为 s-elbat)、Dagobah、TURL 和 TableLlama;其中前两种方法属于基于启发式的算法家族,而另外两种分别为仅编码器和仅解码器的大型语言模型 (LLM)。我们还包括 GPT-4o 和 GPT-4o-mini 在内,因为它们在各种公共基准测试中表现出色。主要目标是衡量这些方法在实体消歧任务中的能力,相对于在统一评估设置下的性能以及涉及的计算和成本要求,以此为最终目标,绘制该领域新的研究路径图。

关键词

引用

@article{arxiv.2408.06423,
  title  = {Evaluating LLMs on Entity Disambiguation in Tables},
  author = {Federico Belotti and Fabio Dadda and Marco Cremaschi and Roberto Avogadro and Matteo Palmonari},
  journal= {arXiv preprint arXiv:2408.06423},
  year   = {2024}
}

备注

13 pages, 6 figures; fixed avg. accuracy-over-price plot for GPT families, fixed typos in table referencing, added evaluation and inference subsubsection