欺骗与混淆的信息论区分
人工智能
2026-03-31 v2 机器学习
摘要
我们提出对两种基本 AI 安全失效模式——欺骗性对齐与目标漂移——之间区分的信息论形式化。虽然两者都可能导致看似不对齐的系统,但我们证明它们代表了在人机系统中不同接口处发生的不同形式的信息散度。欺骗性对齐在智能体的真实目标与其可观测行为之间产生熵,而目标漂移或混淆则在人类预期目标与智能体实际目标之间产生熵。尽管这两种失效在观测上常常等价,但它们需要不同的干预措施。我们提出了一个形式化模型和一个说明性的思想实验来阐明这一区分。我们提供了一种形式化语言,用于重新审视大型语言模型中观察到的突出对齐挑战,为其潜在原因提供了新视角。
引用
@article{arxiv.2501.16448,
title = {Information-theoretic Distinctions Between Deception and Confusion},
author = {Robin Young},
journal= {arXiv preprint arXiv:2501.16448},
year = {2026}
}
备注
Proceedings of the 14th IJCNLP and the 4th AACL (2025)