中文

虚饰还是真金?通过大语言模型从可持续发展报告中提取结构化洞察

计算与语言 2024-01-17 v3 计算工程、金融与科学 计算机与社会

摘要

过去十年间,鉴于投资者对环境、社会与治理(ESG)议题的日益关注,若干监管机构已开始要求上市公司披露非财务信息。关于可持续发展实践的公开信息常以多样、非结构化及多模态文档形式披露,这给高效收集并将数据对齐至统一框架以推导企业社会责任(CSR)相关洞察带来了挑战。因此,使用信息抽取(IE)方法向利益相关者提供有洞察且可操作的数据成为直观选择。本研究中,我们采用大语言模型(LLM)、上下文学习(In-Context Learning)与检索增强生成(RAG)范式,从企业可持续发展报告中抽取与 ESG 方面相关的结构化洞察。随后我们利用基于图的表示对抽取洞察开展统计分析。分析揭示,ESG 标准涵盖超过 500 的广泛主题,常超出既有分类所考虑范围,且企业通过各类举措予以回应。此外,同地区或同行业公司间浮现出披露相似性,验证了 ESG 文献中的既有假设。最后,通过将额外公司属性纳入分析,我们探究了哪些因素对企业 ESG 评级影响最大,表明 ESG 披露对其他财务或公司数据而言对所得评级影响更甚。

关键词

引用

@article{arxiv.2310.05628,
  title  = {Glitter or Gold? Deriving Structured Insights from Sustainability Reports via Large Language Models},
  author = {Marco Bronzini and Carlo Nicolini and Bruno Lepri and Andrea Passerini and Jacopo Staiano},
  journal= {arXiv preprint arXiv:2310.05628},
  year   = {2024}
}