中文

评估生成式语言模型在分类任务中的表现:环境与气候变化领域的性能与自评估能力

计算与语言 2024-09-02 v1

摘要

本文检验了两个大型语言模型(LLM),GPT3.5 和 Llama2,以及一个小型语言模型(SLM)Gemma,在气候变化(CC)和环境领域内三个不同分类任务中的表现。采用基于 BERT 的模型作为基线,我们将它们的有效性与这些基于 Transformer 的模型进行比较。此外,我们通过分析这些文本分类任务中口头化置信度分数的校准来评估模型的自评估能力。我们的研究结果表明,尽管基于 BERT 的模型通常优于 LLM 和 SLM,但大型生成式模型的性能仍然值得关注。此外,我们的校准分析显示,尽管 Gemma 在初始任务中校准良好,但此后产生了不一致的结果;Llama 校准合理,而 GPT 始终表现出很强的校准。通过这项研究,我们旨在为关于生成式语言模型在解决地球上一些最紧迫问题中的效用和有效性的持续讨论做出贡献,并突出它们在生态学和 CC 背景下的优势与局限性。

关键词

引用

@article{arxiv.2408.17362,
  title  = {Assessing Generative Language Models in Classification Tasks: Performance and Self-Evaluation Capabilities in the Environmental and Climate Change Domain},
  author = {Francesca Grasso and Stefano Locci},
  journal= {arXiv preprint arXiv:2408.17362},
  year   = {2024}
}

备注

11 pages, to be published in NLDB 2024