MMESGBench:面向 ESG 任务的多模态理解与复杂推理基准
多媒体
2025-08-18 v2 计算与语言
摘要
环境、社会和治理(ESG)报告是评估可持续性实践、确保监管合规和促进财务透明度的关键文件。然而,这些文件往往篇幅冗长、结构多样且具有多模态特征,包括密集文本、结构化表格、复杂图表以及依赖布局的语义。现有的 AI 系统在此类环境下进行可靠的文件级推理往往难以实现,而目前 ESG 领域尚无专门的基准数据集。为填补这一空白,我们引入了\textbf{MMESGBench},这是一套首创的针对评估多模态理解和跨结构多来源 ESG 文档中复杂推理能力的基准数据集。该数据集通过人类-AI 协作的多阶段管道构建:首先,多模态大语言模型通过联合解读布局感知文档页面中丰富的文本、表格和视觉信息,生成候选问答(QA)对;其次,大语言模型验证每个 QA 对的语义准确性、完整性和推理复杂度。随后进行自动化流程,继而通过专家内置的验证流程,其中领域专家验证和校准 QA 对,以确保质量、相关性和多样性。MMESGBench 包含 933 对经验证的 QA 对,源自 45 份 ESG 报告,覆盖七种不同的文档类型和三个主要的 ESG 来源类别。问题按单页、跨页或不可回答进行分类,每类问题都伴随细粒度的多模态证据。初始实验表明,多模态和检索增强模型在视觉导向和跨页任务上显著优于文本唯一基线。MMESGBench 以开源数据集形式公开,地址为 https://github.com/Zhanglei1103/MMESGBench。
引用
@article{arxiv.2507.18932,
title = {MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks},
author = {Lei Zhang and Xin Zhou and Chaoyue He and Di Wang and Yi Wu and Hong Xu and Wei Liu and Chunyan Miao},
journal= {arXiv preprint arXiv:2507.18932},
year = {2025}
}
备注
Accepted at ACM MM 2025