中文

训练语言模型通过自博弈赢得辩论以提高评判准确性

计算与语言 2024-09-26 v1 人工智能

摘要

我们通过训练模型利用自博弈生成的数据进行辩论,测试了辩论作为一种可扩展监督方法的鲁棒性。在长上下文阅读理解任务中,我们发现,当评判经过优化以赢得辩论的模型时,基于语言模型的评估器回答问题的准确性更高。相比之下,对于在没有对立辩手的情况下训练以说服评判者的顾问模型,我们没有发现这种关系。在我们的辩论模型与新颖的顾问基线之间的定量和定性比较中,我们找到了证据表明,辩论训练鼓励了更强、更具信息量的论点,显示出它有望为难以直接评估的任务提供高质量监督。

关键词

引用

@article{arxiv.2409.16636,
  title  = {Training Language Models to Win Debates with Self-Play Improves Judge Accuracy},
  author = {Samuel Arnesen and David Rein and Julian Michael},
  journal= {arXiv preprint arXiv:2409.16636},
  year   = {2024}
}

备注

48 pages, 12 figures; code at https://github.com/samuelarnesen/nyu-debate-modeling