中文

Skill-Mix:一个灵活可扩展的 AI 模型评估族

计算与语言 2023-10-27 v1 人工智能 机器学习 神经与进化计算

摘要

随着 LLM 将其角色从语言统计建模转向作为通用 AI 智能体,LLM 评估应当如何改变?可以说,AI 智能体的一个关键能力是按需灵活组合其已学习的基本技能。技能组合能力在(人类)教学法中以及一篇关于涌现现象的论文(Arora & Goyal, 2023)中均起着重要作用。本工作引入 Skill-Mix,一种衡量技能组合能力的新评估。使用一份包含 NN 项技能的列表,评估者反复选取大小为 kk 的随机技能子集,并要求 LLM 生成组合该子集技能的文本。由于子集数量随 NkN^k 增长,即使对于中等大小的 kk,该评估也很可能要求 LLM 生成与训练集中任何文本显著不同的文本。本文提出了一种方法用于(a)设计和实施此类评估,以及(b)使用 GPT-4 以及开源的 LLaMA-2 70B 模型对结果进行自动评分(并加以人工抽查)。对流行聊天机器人实施某版本评估所得结果,虽总体符合先前预期,但包含意外之处。模型能力间存在显著差距,而这些差距未被其在流行 LLM 排行榜上的排名所捕捉(“为排行榜 cramming”)。此外,简单的概率计算表明,GPT-4 在 k=5k=5 上的合理表现暗示其超越了“随机鹦鹉”行为(Bender et al., 2021),即它以训练期间未见过的方式组合技能。我们勾勒了该方法如何催生一个基于 Skill-Mix 的开放评估生态,用于未来模型的 AI 能力评估。

关键词

引用

@article{arxiv.2310.17567,
  title  = {Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models},
  author = {Dingli Yu and Simran Kaur and Arushi Gupta and Jonah Brown-Cohen and Anirudh Goyal and Sanjeev Arora},
  journal= {arXiv preprint arXiv:2310.17567},
  year   = {2023}
}