中文

用一致性检验评估超人类模型

机器学习 2023-10-20 v3 人工智能 密码学与安全 机器学习

摘要

如果机器学习模型在各种推理或决策任务上取得超人类能力,鉴于人类必然难以作为真实情况的良好代理,我们将如何评估此类模型?在本文中,我们提出一个通过一致性检验评估超人类模型的框架。我们的前提是:虽然超人类决策的正确性可能无法评估,但如果模型的决策未能满足某些逻辑的、人类可解释的规则,我们仍可以暴露其错误。我们在三个任务上实例化了该框架,这些任务中决策的正确性因超人类模型能力或缺失真实情况而难以评估:评估国际象棋局面、预测未来事件以及作出法律判决。我们表明,无论模型在这些任务上的(可能为超人类的)表现如何,我们都能发现决策中的逻辑不一致性。例如:国际象棋引擎对语义相同的棋盘赋予相反的估值;GPT-4 预测体育纪录会随时间非单调演变;或 AI 法官仅在我们向被告犯罪记录中添加一项重罪后才准予保释。

关键词

引用

@article{arxiv.2306.09983,
  title  = {Evaluating Superhuman Models with Consistency Checks},
  author = {Lukas Fluri and Daniel Paleka and Florian Tramèr},
  journal= {arXiv preprint arXiv:2306.09983},
  year   = {2023}
}

备注

42 pages, 18 figures. Code and data are available at https://github.com/ethz-spylab/superhuman-ai-consistency