中文

ESGenius:在环境、社会与治理 (ESG) 及可持续性知识上对 LLM 的基准测试

计算与语言 2026-03-09 v2 人工智能 机器学习

摘要

我们引入了 ESGenius,一个用于评估和增强大型语言模型 (LLM) 在环境、社会与治理 (ESG) 及聚焦可持续性的问答中能力的综合基准。ESGenius 包含两个关键组件:(i) ESGenius-QA,一个由 LLM 生成并经领域专家严格验证的 1,136 道多选题 (MCQ) 集合,涵盖广泛的 ESG 支柱和可持续性主题。每个问题都系统地链接到其源文本,从而实现透明评估并支持检索增强生成 (RAG) 方法;以及 (ii) ESGenius-Corpus,一个精心策划的资料库,包含来自 7 个权威来源的 231 份基础框架、标准、报告和建议文档。此外,为了充分评估 LLM 的能力和适应潜力,我们实施了一个严格的两阶段评估协议——Zero-Shot 和 RAG。在 50 个 LLM(0.5B 到 671B)上的广泛实验表明,最先进的模型在 zero-shot 设置下仅达到中等性能,准确率约为 55--70%,突显了 LLM 在这一专门的跨学科领域存在显著的知识差距。然而,采用 RAG 的模型表现出显著的性能提升,特别是对于较小的模型。例如,DeepSeek-R1-Distill-Qwen-14B 从 63.82% (zero-shot) 提升至使用 RAG 的 80.46%。这些结果表明,有必要将回复基于权威来源以增强对 ESG 的理解。据我们所知,ESGenius 是首个旨在严格评估 LLM 在 ESG 和可持续性知识方面的综合问答基准,为推进这一重要领域可信赖的 AI 提供了关键工具。

关键词

引用

@article{arxiv.2506.01646,
  title  = {ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge},
  author = {Chaoyue He and Xin Zhou and Yi Wu and Xinjia Yu and Yan Zhang and Lei Zhang and Di Wang and Shengfei Lyu and Hong Xu and Xiaoqiao Wang and Wei Liu and Chunyan Miao},
  journal= {arXiv preprint arXiv:2506.01646},
  year   = {2026}
}

备注

EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award