训练语言模型通过自博弈赢得辩论以提高评判准确性
计算与语言
2024-09-26 v1 人工智能
摘要
我们通过训练模型利用自博弈生成的数据进行辩论,测试了辩论作为一种可扩展监督方法的鲁棒性。在长上下文阅读理解任务中,我们发现,当评判经过优化以赢得辩论的模型时,基于语言模型的评估器回答问题的准确性更高。相比之下,对于在没有对立辩手的情况下训练以说服评判者的顾问模型,我们没有发现这种关系。在我们的辩论模型与新颖的顾问基线之间的定量和定性比较中,我们找到了证据表明,辩论训练鼓励了更强、更具信息量的论点,显示出它有望为难以直接评估的任务提供高质量监督。
引用
@article{arxiv.2409.16636,
title = {Training Language Models to Win Debates with Self-Play Improves Judge Accuracy},
author = {Samuel Arnesen and David Rein and Julian Michael},
journal= {arXiv preprint arXiv:2409.16636},
year = {2024}
}
备注
48 pages, 12 figures; code at https://github.com/samuelarnesen/nyu-debate-modeling