更换灯泡需要多少参数?评估自我对弈式对话游戏中的性能随模型特征的变化
计算与语言
2024-06-21 v1 人工智能
摘要
什么才是好的大型语言模型(Large Language Model, LLM)?答案是它在相关基准测试中的表现——这些基准测试 hopefully衡量了某些能力的存在,这些能力也在现实应用中受到挑战。但究竟是什么让模型表现出色?什么赋予了模型其能力?我们采用一种新近提出的基准测试类型,旨在通过自我对弈式对话游戏来挑战目标导向、代理性的能力,并分析性能随模型特征(如参数数量或训练类型)变化的规律。我们发现,尽管参数数量与性能之间存在明确关系,但在给定规模范围内仍存在较大的性能分布,这需要用训练参数(如微调数据质量和方法)来解释。从更实用的角度来看,我们也发现性能在不同访问方法下呈现出一定的不可预测性,这可能是由于未公开的采样参数,以及在推理期间对中等程度的权重量化仍能保持稳定性能,这是一件令人愉快的事。
引用
@article{arxiv.2406.14051,
title = {How Many Parameters Does it Take to Change a Light Bulb? Evaluating Performance in Self-Play of Conversational Games as a Function of Model Characteristics},
author = {Nidhir Bhavsar and Jonathan Jordan and Sherzod Hakimov and David Schlangen},
journal= {arXiv preprint arXiv:2406.14051},
year = {2024}
}
备注
under review