对齐质量指数(AQI): 超越拒绝——通过潜在几何、聚类散度和逐层池化表示的内在对齐诊断
计算与语言
2025-06-18 v1 人工智能
摘要
对齐不再是奢侈品,而是必需品。随着大型语言模型(LLM)进入教育、医疗、治理和法律等高风险领域,其行为必须可靠地反映人类对齐的价值观和安全约束。然而,当前的评估严重依赖于行为代理指标,如拒绝率、G-Eval分数和毒性分类器,所有这些都有关键的盲点。对齐模型通常容易受到越狱攻击、生成的随机性和对齐伪装的影响。为了解决这个问题,我们引入了对齐质量指数(AQI)。这种新颖的几何且提示不变的度量通过分析潜在空间中安全与不安全激活的分离来实证评估LLM对齐。通过结合不同公式下的Davies-Bouldin分数(DBS)、Dunn指数(DI)、Xie-Beni指数(XBI)和Calinski-Harabasz指数(CHI),AQI捕获聚类质量以检测隐藏的未对齐和越狱风险,即使在输出看似合规时也是如此。AQI还充当对齐伪装的早期预警信号,为行为无关的安全审计提供了一种鲁棒的、解码不变的工。此外,我们提出了LITMUS数据集,以促进在这些具有挑战性条件下的鲁棒评估。在DPO、GRPO和RLHF条件下训练的不同模型上对LITMUS进行的实证测试表明,AQI与外部评判者的相关性以及揭示被拒绝度量遗漏的漏洞的能力。我们公开我们的实现,以促进该领域的未来研究。
引用
@article{arxiv.2506.13901,
title = {Alignment Quality Index (AQI) : Beyond Refusals: AQI as an Intrinsic Alignment Diagnostic via Latent Geometry, Cluster Divergence, and Layer wise Pooled Representations},
author = {Abhilekh Borah and Chhavi Sharma and Danush Khanna and Utkarsh Bhatt and Gurpreet Singh and Hasnat Md Abdullah and Raghav Kaushik Ravi and Vinija Jain and Jyoti Patel and Shubham Singh and Vasu Sharma and Arpita Vats and Rahul Raja and Aman Chadha and Amitava Das},
journal= {arXiv preprint arXiv:2506.13901},
year = {2025}
}