语言模型自我对弈在非零和博弈中的有效性
计算与语言
2024-12-10 v2
摘要
像 AlphaGo 这样的游戏代理通过自我对弈实现超人水平的表现,这在竞争性游戏中被理论保证能产生最优策略。然而,大多数语言任务是部分或完全合作的,因此是否可以有效地应用于语言模型自我对弈以提升性能,仍是一个开放问题。我们在一种称为 Deal or No Deal (DoND) 的谈判游戏设置中进行经验性研究。关键在于,DoND 的目标可被修改以产生完全合作的游戏、严格竞争的游戏,或两者之间的任何形式。我们对这些目标分别在 DoND 中进行多轮过滤行为克隆的自我对弈微调语言模型,并在自我对弈和与人类合作中对其进行评估。我们发现语言模型在自我对弈中取得显著改进,微调后在任务奖励上提升了 14-17 倍。进一步地,训练后的模型在与人类合作和竞争时均表现出色,得分比基础模型高出 2.5-6 倍。我们将这些结果视为语言模型在合作环境中进行自我对弈的初步有前景的征兆,尽管缺乏理论保证。
引用
@article{arxiv.2406.18872,
title = {Efficacy of Language Model Self-Play in Non-Zero-Sum Games},
author = {Austen Liao and Nicholas Tomlin and Dan Klein},
journal= {arXiv preprint arXiv:2406.18872},
year = {2024}
}