知识发散与可扩展监督的辩论价值
机器学习
2026-03-06 v1 计算与语言
摘要
AI 通过辩论和从 AI 反馈获取强化学习(RLAIF)都是 proposed 方法,用于可扩展监督高级 AI 系统,但没有形式框架将它们关联或描述辩论何时提供优势。我们通过参数化辩论价值来分析其通过模型表示子空间之间知识发散的几何来实现。我们使用模型表示子空间之间的主角度,证明辩论优势具有确切闭式。当模型共享相同的训练语料库时,辩论简化为 RLAIF-like,其中单智能体方法恢复相同的 optimum。当模型拥有发散的知识时,辩论优势从二次 regime(辩论几乎没有帮助)到线性 regime(辩论至关重要)进行相位转变。我们对知识发散的三个 regime(共享、单向和组合)进行分类,并提供存在结果,表明辩论可以实现单一模型无法实现的成果,同时提供一个负结果,表明当组合 regime 中的对抗性激励足够强时,辩论会出现协调失败,并有一个锐利的阈值分隔有效与无效的辩论。我们提供了辩论与 RLAIF 的第一个形式性联系,为理解何时合理使用对抗监督协议提供了几何基础,并与在补充信息的模型之间寻求潜在知识相关问题相关联。
引用
@article{arxiv.2603.05293,
title = {Knowledge Divergence and the Value of Debate for Scalable Oversight},
author = {Robin Young},
journal= {arXiv preprint arXiv:2603.05293},
year = {2026}
}