中文

基于极性的探测:用于量化语言模型中潜在对齐性

计算与语言 2025-12-01 v1 人工智能

摘要

无监督探测方法如对比一致搜索(Contrast-Consistent Search, CCS)揭示模型内部信念而无需依赖标记输出,引发了这些方法能否可靠评估模型对齐性的疑问。我们通过检验 CCS 对有害与安全语句的敏感性,并引入基于极性的 CCS(Polarity-Aware CCS, PA-CCS),用于评估模型内部表征在极性反转下是否保持一致。我们提出了两种面向对齐的指标——极性一致性(Polar-Consistency)和矛盾指数(Contradiction Index),用于量化模型潜在知识的语义鲁棒性。为验证 PA-CCS,我们构建了两个主要数据集和一个控制数据集,包含使用不同方法构建的匹配有害-安全句子对(包括并行与对抗语句)。我们将 PA-CCS 应用于 16 个语言模型。结果表明,PA-CCS 能够识别出模型内部对潜在有害知识编码的架构差异和层级差异。值得注意的是,对于内部表征已知对齐且具备鲁棒性的模型,替换否定标记为无意义标记会导致 PA-CCS 分数下降;而那些缺乏健壮内部校准的模型则不表现出这种下降。我们的发现凸显了无监督探测在对齐评估中的潜力,并强调将结构鲁棒性检查纳入可解释性基准测试的必要性。代码和数据集已公开于 https://github.com/SadSabrina/polarity-probing。警告:本论文包含可能具有敏感、有害和冒犯性内容。

关键词

引用

@article{arxiv.2511.21737,
  title  = {Polarity-Aware Probing for Quantifying Latent Alignment in Language Models},
  author = {Sabrina Sadiekh and Elena Ericheva and Chirag Agarwal},
  journal= {arXiv preprint arXiv:2511.21737},
  year   = {2025}
}

备注

7 pages