中文

大型语言模型用于SDG映射性能评估

机器学习 2024-08-06 v1 计算与语言

摘要

大型语言模型(LLMs)的使用正在快速扩张,开源版本也日益可获得,为用户提供了更安全和更可定制的选项。这些模型使用户能够通过消除向第三方提供数据的需求来保护数据隐私,并且可以针对特定任务进行定制。本研究将各种语言模型在可持续发展目标(SDG)映射任务上的性能进行比较,以GPT-4o的输出作为基准。所选用于比较的开源模型包括Mixtral、LLaMA 2、LLaMA 3、Gemma和Qwen2。此外,还包括GPT-4o-mini,这是GPT-4o的一个更专门的版本,以扩展比较。鉴于SDG映射任务的多标签性质,我们采用F1分数、精确率和召回率等指标,并使用微平均方法来评估不同模型的性能。这些指标源自混淆矩阵,以确保全面评估。我们通过绘制F1分数、精确率和召回率在不同阈值下的曲线,对每个模型的性能进行清晰的观察和分析。根据本实验的结果,LLaMA 2和Gemma仍有显著的改进空间。其他四个模型之间不存在特别大的性能差异。来自所有七个模型的输出已在Zenodo上提供:https://doi.org/10.5281/zenodo.12789375。

关键词

引用

@article{arxiv.2408.02201,
  title  = {Evaluating the Performance of Large Language Models for SDG Mapping (Technical Report)},
  author = {Hui Yin and Amir Aryani and Nakul Nambiar},
  journal= {arXiv preprint arXiv:2408.02201},
  year   = {2024}
}