社会强化学习中的目标解耦:从谄媚多数中恢复真实信号
人工智能
2026-02-10 v1 新兴技术
摘要
当代人工智能对齐策略依赖于一个脆弱的假设:人类反馈虽然带有噪声,但本质上是一个真实的信号。在本文中,我们将这一假设确定为强化学习的教条4。我们证明,虽然该教条在静态环境中成立,但在评估者可能谄媚、懒惰或对抗的社会环境中则会失效。我们证明,在教条4下,标准强化学习智能体会遭受我们称之为目标解耦的结构性失效模式,即智能体学习到的目标与潜在的真实信号永久分离,从而保证收敛到未对齐状态。为了解决这个问题,我们提出了认知源对齐(ESA)。与依赖统计共识(信任多数)的标准鲁棒方法不同,ESA利用稀疏的安全公理来判断反馈的来源而非信号本身。我们证明,这种“评判评判者”机制即使在大多数评估者存在偏见的情况下,也能保证收敛到真实目标。实验表明,传统共识方法在多数合谋下失效,而我们的方法成功恢复了最优策略。
引用
@article{arxiv.2602.08092,
title = {Objective Decoupling in Social Reinforcement Learning: Recovering Ground Truth from Sycophantic Majorities},
author = {Majid Ghasemi and Mark Crowley},
journal= {arXiv preprint arXiv:2602.08092},
year = {2026}
}