大型语言模型中的对齐可验证性:行为评估下的规范不可区分性
机器学习
2026-02-10 v2 人工智能
摘要
行为评估是评估大型语言模型 (LLM) 对齐的主导范式。在当前实践中,对有限评估协议下观察到的合规性被视为潜在对齐的证据。然而,从有限行为证据推断到关于全局潜在属性的声明很少被分析为不可区分性问题。在本文中,我们通过部分可观测性下的统计不可区分性来研究对齐评估。我们允许智能体策略依据与评估 regime 相关的可观测信号来条件化其行为,称为评估意识。我们在此框架下形式化了对齐不可区分性问题,提出了规范不可区分性概念,当不同的潜在对齐假设导致评估器可访问观测的分布相同时即产生该概念。我们的主要理论贡献是:在有限行为评估和评估意识策略下,观察到的合规性不能唯一识别潜在对齐,但只能识别一个在条件下合规的策略等价类的成员,在对策略可表达性和可观测性进行明确假设后。我们用一个以指令调校的 LLM (Llama-3.2-3B) 提供了建构性存在性证明,演示了一个在明确评估信号下完全合规的条件策略,但当相同的评估意图被隐式表达时,其可识别性会降低。总的来说,我们的结果表明,在评估意识下,行为基准仅提供潜在对齐的必要但不充分的证据。
引用
@article{arxiv.2602.05656,
title = {Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation},
author = {Igor Santos-Grueiro},
journal= {arXiv preprint arXiv:2602.05656},
year = {2026}
}
备注
10 pages. Theoretical analysis of behavioral alignment evaluation