中文

ESG-Bench:用于 ESG 报告 hallucination 缓解的长上下文基准

计算与语言 2026-03-16 v1 人工智能

摘要

随着公司责任越来越多地纳入环境、社会和治理(ESG)标准,ESG 报告正在成为许多地区的法律要求,并且是 documenting 可持续实践和评估企业长期和伦理绩效的关键渠道。然而,ESG 披露的长度和复杂性使得其难以解释且可靠地自动化分析具有挑战性。为支持可扩展且可信的分析,本文引入 ESG-Bench,这是一个用于 ESG 报告理解和大语言模型(LLM)中 hallucination 缓解的基准数据集。ESG-Bench 包含基于真实世界 ESG 报告情境的人工标注的 question-answer(QA) 对,标注细粒度指示模型输出是否受事实支持或被 hallucination。将 ESG 报告分析建模为带有可验证约束的 QA 任务,可实现对 LLM 从 ESG 内容中提取和推理能力的系统评估,并为缓解社会敏感、合规关键场景中的 hallucination 提供了新用例。我们设计了特定于任务的链式思维(CoT) 提示策略,并在 ESG-Bench 上对多个最先进 LLM 进行 CoT 标注的理性书进行微调。我们的实验表明,这些 CoT 方法在减少 hallucination 方面显著优于标准提示和直接微调,并且这些收益可转移到 ESG 领域之外的现有 QA 基准测试。

关键词

引用

@article{arxiv.2603.13154,
  title  = {ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation},
  author = {Siqi Sun and Ben Peng Wu and Mali Jin and Peizhen Bai and Hanpei Zhang and Xingyi Song},
  journal= {arXiv preprint arXiv:2603.13154},
  year   = {2026}
}

备注

To be published in the AAAI 2026 proceedings