中文

大语言模型在环境评估与许可中的基准测试

计算与语言 2025-06-13 v3

摘要

国家环境政策法案(NEPA)是美国环境立法的基石,要求联邦机构在其拟行动的环境影响后进行考虑。实现这一目标的主要机制是通过准备环境评估(EA)以及对于重大影响的综合性环境影响声明(EIS)。大型语言模型(LLM)在NEPA等专业领域的效果尚未用于联邦决策过程中。为填补这一空白,我们提出了NEPA问答数据集(NEPAQuAD),该数据集源自EIS文件,首次实现全面基准测试,伴随模块化且透明的评估管道MAPLE,用于评估LLM在NEPA聚焦的监管推理任务。我们的基准测试利用实际EIS文件创建多样化的问题类型,从事实性问题到复杂问题解决问题。我们构建了模块化且透明的评估管道,用于测试闭源和开源模型在零-shot或情境驱动的QA基准测试中。我们使用该框架对五种最先进的LLM进行评估,以评估其先验知识以及处理NEPA特定信息的能力。实验结果表明,所有模型在提供黄金段落作为情境时均实现最佳性能。虽然在每种模型下进行其他情境驱动方法的比较,基于RAG的方法在PDF文档情境方面显著优于文档情境,表明模型不太适合处理长情境问答任务。我们的分析表明,NEPA聚焦的监管推理任务对LLM构成重大挑战,尤其是在理解复杂语义和有效处理长篇监管文件方面。

关键词

引用

@article{arxiv.2407.07321,
  title  = {Benchmarking LLMs for Environmental Review and Permitting},
  author = {Rounak Meyur and Hung Phan and Koby Hayashi and Ian Stewart and Shivam Sharma and Sarthak Chaturvedi and Mike Parker and Dan Nally and Sadie Montgomery and Karl Pazdernik and Ali Jannesari and Mahantesh Halappanavar and Sai Munikoti and Sameera Horawalavithana and Anurag Acharya},
  journal= {arXiv preprint arXiv:2407.07321},
  year   = {2025}
}

备注

15 pages