警惕词汇:以 ChatGPT 为例评估对话式大语言模型的词汇多样性
计算与语言
2024-10-22 v2
摘要
对话式大语言模型 (LLM) 的性能,尤其是 ChatGPT 的性能,目前正在许多不同任务上进行评估,从逻辑推理或数学到回答各种主题的问题。相比之下,对这些 LLM 生成文本的语言特征的研究受到的关注要少得多。这令人惊讶,因为 LLM 是语言模型,理解它们如何使用语言至关重要。事实上,对话式 LLM 有望对语言的演变产生重大影响,因为它们最终可能主导新文本的创造。这意味着,例如,如果对话式 LLM 不使用某个单词,该单词的频率可能会越来越低,最终完全停止使用。因此,评估它们生成的文本的语言特征以及这些特征如何依赖于模型参数,是理解对话式 LLM 对语言演变潜在影响的第一步。在本文中,我们考虑评估 LLM 生成文本的词汇丰富度及其对模型参数的依赖性。我们提出了一种方法论,并以 ChatGPT 为例进行了全面的词汇丰富度评估。结果表明,词汇丰富度取决于 ChatGPT 的版本及其某些参数,如存在惩罚 (presence penalty),或分配给模型的角色。我们分析中使用的数据集和工具在开放许可下发布,旨在引起人们对评估 LLM 生成文本语言特征的迫切关注。
引用
@article{arxiv.2402.15518,
title = {Beware of Words: Evaluating the Lexical Diversity of Conversational LLMs using ChatGPT as Case Study},
author = {Gonzalo Martínez and José Alberto Hernández and Javier Conde and Pedro Reviriego and Elena Merino},
journal= {arXiv preprint arXiv:2402.15518},
year = {2024}
}