中文

大语言模型生成的可持续性相关词汇定义的准确性、鲁棒性与可读性

计算与语言 2025-02-04 v1

摘要

具有标准化定义的通用语言对于有效的气候讨论至关重要。然而,人们担心大语言模型(LLM)会歪曲气候术语。我们比较了300个官方的IPCC术语表定义与GPT-4o-mini、Llama3.1 8B和Mistral 7B生成的定义,使用SBERT句子嵌入分析了其一致性、鲁棒性和可读性。这些LLM的平均一致性得分为0.570.59±0.150.57-0.59 \pm 0.15,并且它们生成的定义比原始定义更难阅读。模型生成的定义主要在具有多重或模糊含义的词汇上存在差异,显示出其突出需要标准化的术语的潜力。结果展示了LLM如何支持环境话语,同时强调了需要使模型输出与既定术语保持一致,以确保清晰性和一致性。

关键词

引用

@article{arxiv.2502.00916,
  title  = {The Accuracy, Robustness, and Readability of LLM-Generated Sustainability-Related Word Definitions},
  author = {Alice Heiman},
  journal= {arXiv preprint arXiv:2502.00916},
  year   = {2025}
}

备注

NLP4Ecology Workshop 2025