几何 Canary:通过表征稳定性预测可操控性与检测漂移
机器学习
2026-04-30 v2 计算与语言
机器学习
摘要
可靠部署语言模型需要两项能力:一种是预测模型是否能接受定向行为控制,另一种是检测其内部结构是否退化。这两种看似独立的能力实际上共享相同的几何基础。我们表明,几何稳定性——即表示形式两两距离结构一致性——可同时解决这两个问题。衡量任务对齐几何稳定性的监督式 Shesha 变体在 35-69 个嵌入模型和三个 NLP 任务上,能够以近乎完美的准确度(-)预测线性可操控性,捕捉的方差超出类别可分离性(部分 -)。关键分离现象出现:无监督式稳定性在实际任务中完全无法实现可操控性预测(),表明任务对齐是可操控性预测的必需条件。然而,无监督式稳定性在漂移检测方面却表现出色,测得的几何变化为 CKA 的约 (在 Llama 中可达 ),同时在 73% 的模型中提供更早的预警,其误报率仅为 Procrustes 的 。综上,监督式和无监督式稳定性形成互补的诊断工具,前者用于部署前的可操控性评估,后者用于部署后的监控。
引用
@article{arxiv.2604.17698,
title = {The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability},
author = {Prashant C. Raju},
journal= {arXiv preprint arXiv:2604.17698},
year = {2026}
}