中文

利用词语猜测游戏评估大语言模型的智能水平

计算与语言 2023-11-07 v2

摘要

基于LLM的智能体之智能的自动评估,在开发先进基于LLM的智能体过程中至关重要。尽管已投入大量精力开发人工标注的评估数据集(如AlpacaEval),现有技术仍成本高、耗时长且缺乏适应性。在本文中,受流行语言游戏“谁是卧底”启发,我们提出使用词语猜测游戏来评估LLM的智能表现。给定一个词,要求LLM根据自己及其他玩家的描述来描述该词并判定其身份(卧底与否)。理想情况下,一个先进的智能体应具备以激进描述准确描述给定词、同时在保守描述中最大化混淆以增强其游戏参与度的能力。为此,我们首先开发DEEP以评估LLM的表达与伪装能力。DEEP要求LLM以激进与保守两种模式描述一个词。我们随后引入SpyGame,一个通过参与竞争性语言棋盘游戏来评估LLM智能的交互式多智能体框架。SpyGame结合多智能体交互,要求目标LLM具备语言技能与战略思维,从而对LLM类人认知能力与复杂沟通情境中的适应性提供更全面的评估。所提评估框架极易实现。我们从多来源、多领域与多语言收集词语,并使用所提评估框架开展实验。大量实验表明,所提DEEP与SpyGame能有效评估各类LLM的能力,捕捉其适应新情境与进行战略沟通的能力。

关键词

引用

@article{arxiv.2310.20499,
  title  = {Leveraging Word Guessing Games to Assess the Intelligence of Large Language Models},
  author = {Tian Liang and Zhiwei He and Jen-tse Huang and Wenxuan Wang and Wenxiang Jiao and Rui Wang and Yujiu Yang and Zhaopeng Tu and Shuming Shi and Xing Wang},
  journal= {arXiv preprint arXiv:2310.20499},
  year   = {2023}
}

备注

Work in progress