中文

利用大型语言模型从历史油井记录中提取信息

信息检索 2024-05-10 v1

摘要

为了降低孤儿井(废弃的油气井)带来的环境风险与影响,首先定位并封堵这些井至关重要。尽管存在一些历史文档,但它们通常是非结构化的、未经清洗的且已过时。此外,它们在各州和类型之间差异很大。鉴于油井数量庞大,通过人工阅读并将这些历史文档中的信息数字化是不可行的。在此,我们提出了一种新的计算方法,以快速且经济高效地定位这些井。具体而言,我们利用大型语言模型(LLM)的先进能力,从孤儿井的历史记录中提取包括井位和深度在内的关键信息。在本文中,我们提出了一种基于开源 Llama 2 模型的信息提取工作流,并在包含 160 份油井文档的数据集上进行了测试。结果表明,所开发的工作流在从基于 PDF 的整洁报告中提取位置和深度时具有极高的准确率,准确率达到 100%。然而,在处理非结构化的基于图像的油井记录时存在困难,准确率降至 70%。该工作流相比人工数字化具有显著优势,包括减少劳动力和提高自动化程度。总体而言,更详细的提示能改善信息提取效果,且具有更多参数的 LLM 通常表现更好。我们详细讨论了当前面临的挑战以及应对这些挑战的相应机遇与方法。此外,大量地球科学信息被锁定在旧文档中,这项工作表明 LLM 的最新突破使我们能够更广泛地解锁这些信息。

关键词

引用

@article{arxiv.2405.05438,
  title  = {Information Extraction from Historical Well Records Using A Large Language Model},
  author = {Zhiwei Ma and Javier E. Santo and Greg Lackey and Hari Viswanathan and Daniel O'Malley},
  journal= {arXiv preprint arXiv:2405.05438},
  year   = {2024}
}