中文

如何衡量大语言模型的智能?

人工智能 2024-07-31 v1 机器学习

摘要

随着ChatGPT及其他大语言模型(LLMs)的发布,关于当前及未来模型的智能、可能性与风险的讨论备受关注。这一讨论包含了许多备受争议的场景,即所谓的“超人类”人工智能(AI)即将崛起,也就是比人类聪明数个数量级的AI系统。秉承艾伦·图灵的精神,当前最先进的语言模型无疑已经通过了他著名的测试。此外,当前模型在多项基准测试中的表现已超越人类,因此公开可用的大语言模型已成为连接日常生活、工业与科学的多面手。尽管能力令人印象深刻,LLMs有时会在对人类而言微不足道的任务上完全失败。在其他情况下,LLMs的可信度变得更加难以捉摸和评估。以学术界为例,语言模型仅需少量输入就能撰写关于给定主题的、令人信服的研究文章。然而,在事实一致性方面的可信度缺失,或AI生成文本中持续存在的幻觉,已导致许多科学期刊对基于AI的内容施加了一系列限制。鉴于这些观察,一个问题随之而来:适用于人类智能的衡量标准是否也能应用于计算方法?这个问题已被广泛讨论。事实上,衡量标准的选择已被证明会极大地影响对潜在智能涌现的评估。在此,我们认为,LLMs的智能不应仅通过特定任务的统计指标来评估,而应分别从定性和定量两个维度进行衡量。

关键词

引用

@article{arxiv.2407.20828,
  title  = {How to Measure the Intelligence of Large Language Models?},
  author = {Nils Körber and Silvan Wehrli and Christopher Irrgang},
  journal= {arXiv preprint arXiv:2407.20828},
  year   = {2024}
}

备注

3 pages, 1 figure