中文

HySem: 一种面向非结构化表格提取的上下文长度优化 LLM 流水线

计算与语言 2024-10-08 v2 人工智能

摘要

制药行业的法规合规报告依赖详细表格,但这些表格由于其非结构化格式和任意内容而常常在合规之外未被充分利用。从 HTML 表格中提取和语义表示表格数据具有挑战性,因为表格呈现方式多样。大语言模型(LLM)在语义表示方面展现出巨大潜力,但它们面临准确性和上下文大小限制的挑战,这对行业应用至关重要。我们提出了 HySem,一个采用新型上下文长度优化技术的流水线,可从 HTML 表格生成精确的语义 JSON 表示。该方法利用专门针对成本和隐私敏感的小型和中型制药企业设计的定制微调模型。在商品硬件上运行并利用开源模型,HySem 在准确性方面超越了同类开源模型,并在与 OpenAI GPT-4o 的基准测试中提供了具有竞争力的性能,有效解决了上下文长度限制这一支持更大表格的关键因素。

关键词

引用

@article{arxiv.2408.09434,
  title  = {HySem: A context length optimized LLM pipeline for unstructured tabular extraction},
  author = {Narayanan PP and Anantharaman Palacode Narayana Iyer},
  journal= {arXiv preprint arXiv:2408.09434},
  year   = {2024}
}

备注

19 pages, 7 tables, 10 figures, 2 algorithms