通过递归自我批判实现对超人类 AI 的可扩展监督
人工智能
2026-01-16 v4 计算与语言
机器学习
摘要
随着 AI 能力在复杂任务中日益超越人类水平,当前的对齐技术,包括 SFT 和 RLHF,在确保可靠监督方面面临根本性挑战。这些方法依赖于直接的人类评估,当 AI 输出超出人类认知阈值时变得不切实际。为应对这一挑战,我们探索了两个假设:(1) \textit{对批判的批判可能比批判本身更容易},将广泛接受的“验证比生成更容易”这一观察扩展到批判领域,因为批判本身是一种特殊形式的生成;(2) \textit{这种难度关系递归地成立},表明当直接评估不可行时,执行更高阶的批判(例如,对批判的批判的批判)提供了一条更易处理的监督路径。我们进行了人-人、人-AI 和 AI-AI 实验,以研究递归自评在 AI 监督中的潜力。我们的结果突显了递归批判作为一种有前景的可扩展 AI 监督方法。
引用
@article{arxiv.2502.04675,
title = {Scalable Oversight for Superhuman AI via Recursive Self-Critiquing},
author = {Xueru Wen and Jie Lou and Xinyu Lu and Junjie Yang and Yanjiang Liu and Yaojie Lu and Debing Zhang and Xing Yu},
journal= {arXiv preprint arXiv:2502.04675},
year = {2026}
}