中文

Statements:基于大语言模型从表格中提取信息的通用方法

计算与语言 2024-10-01 v1 人工智能 信息检索

摘要

环境、社会和治理(ESG)关键绩效指标(KPI)评估组织在气候变化、温室气体排放、用水量、废物管理、人权、多样性和政策等方面的绩效。ESG报告通过表格传递这些宝贵的定量信息。然而,由于表格结构和内容的高变异性,提取这些信息困难。我们提出Statements,一种用于从表格中提取定量事实及相关信息的新型领域无关数据结构。我们提出将表格翻译为语句作为一种新的监督式深度学习通用信息提取任务。我们引入SemTabNet——一个包含超过10万张标注表格的数据集。通过一系列基于T5的Statements提取模型,我们的最佳模型生成的语句与真实答案的相似度达到82%(远高于基线的21%)。我们通过将模型应用于2700多张ESG报告中的表格,展示了Statements方法的优势。由于Statements的统一性,可对大规模ESG报告集合中发现的广泛信息进行探索性数据分析。

关键词

引用

@article{arxiv.2406.19102,
  title  = {Statements: Universal Information Extraction from Tables with Large Language Models for ESG KPIs},
  author = {Lokesh Mishra and Sohayl Dhibi and Yusik Kim and Cesar Berrospi Ramis and Shubham Gupta and Michele Dolfi and Peter Staar},
  journal= {arXiv preprint arXiv:2406.19102},
  year   = {2024}
}

备注

Accepted at the NLP4Climate workshop in the 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)