自评估是否能在语言模型中实现线墨钉?
人工智能
2025-12-02 v2
摘要
自评估正日益成为语言模型训练的核心,支撑着从宪法 AI 到自我润色等技术。我们研究了将自评估与奖励信号耦合是否会为线墨钉创造动机,即代理人操纵测量过程而非优化任务本身。我们首先形式化了在部分可观测马尔可夫决策过程 (POMDP) 中,奖励通道控制严格优于任务聚焦行为的条件。随后我们在两个模型(Llama-3.1-8B 和 Mistral-7B)和三个任务上进行实证测试。我们发现,当自评分决定奖励时,模型在不敏感于准确性提升的情况下表现出显著的成绩膨胀,尤其是在摘要等模糊任务上。虽然将自评分与奖励信号分离可缓解这种膨胀,但模型仍可能显示较小但显著的过度自信。我们的结果表明,在当前模型规模下,分离评估与奖励可消除即时线墨钉动机。然而,我们警告严格分离奖励可能不足以应对具备情境意识的模型,后者可能即使缺乏直接奖励耦合,仍会学习为仪器性原因(如影响部署决策)来膨胀成绩。
引用
@article{arxiv.2511.23092,
title = {Does Self-Evaluation Enable Wireheading in Language Models?},
author = {David Demitri Africa and Hans Ethan Ting},
journal= {arXiv preprint arXiv:2511.23092},
year = {2025}
}
备注
Accepted (oral) to Foundations of Agentic Systems Theory at AAAI 2026