评估 ESG 领域专用预训练大语言模型在文本分类任务中的性能
计算与语言
2024-10-02 v1
摘要
本研究旨在对环境、社会和治理(ESG)信息进行文本披露内容的分类。目标是开发和评估能够准确识别和分类 E、S 和 G 相关内容的二进制分类模型。本研究的动机源于 ESG 考量在投资决策和企业问责方面的日益重要。准确且高效的 ESG 信息分类对于利益相关者理解企业对可持续性的影响并做出明智决策至关重要。该研究采用定量方法,包括数据收集、数据预处理以及开发针对 ESG 领域的大语言模型(LLM)和传统机器学习(支持向量机、XGBoost)分类器。通过采用准确的精度、召回率、F1 分数等标准自然语言处理性能指标,对传统机器学习技术(支持向量机、XGBoost)、最先进的语言模型(FinBERT-ESG)以及如 Llama 2 等微调 LLM 进行比较。应用一种新颖的微调方法 Qlora,显著提升了所有 ESG 领域的模型性能。该研究还开发了领域特定的微调模型,如 EnvLlama 2-Qlora、SocLlama 2-Qlora 和 GovLlama 2-Qlora,这些模型在 ESG 文本分类方面表现出色。
引用
@article{arxiv.2410.00207,
title = {Evaluating the performance of state-of-the-art esg domain-specific pre-trained large language models in text classification against existing models and traditional machine learning techniques},
author = {Tin Yuet Chung and Majid Latifi},
journal= {arXiv preprint arXiv:2410.00207},
year = {2024}
}
备注
56 pages, 9 figures