中文

几何 Canary:通过表征稳定性预测可操控性与检测漂移

机器学习 2026-04-30 v2 计算与语言 机器学习

摘要

可靠部署语言模型需要两项能力:一种是预测模型是否能接受定向行为控制,另一种是检测其内部结构是否退化。这两种看似独立的能力实际上共享相同的几何基础。我们表明,几何稳定性——即表示形式两两距离结构一致性——可同时解决这两个问题。衡量任务对齐几何稳定性的监督式 Shesha 变体在 35-69 个嵌入模型和三个 NLP 任务上,能够以近乎完美的准确度(ρ=0.89\rho = 0.89-0.970.97)预测线性可操控性,捕捉的方差超出类别可分离性(部分 ρ=0.62\rho = 0.62-0.760.76)。关键分离现象出现:无监督式稳定性在实际任务中完全无法实现可操控性预测(ρ0.10\rho \approx 0.10),表明任务对齐是可操控性预测的必需条件。然而,无监督式稳定性在漂移检测方面却表现出色,测得的几何变化为 CKA 的约 2×2\times(在 Llama 中可达 5.23×5.23\times),同时在 73% 的模型中提供更早的预警,其误报率仅为 Procrustes 的 1/61/6。综上,监督式和无监督式稳定性形成互补的诊断工具,前者用于部署前的可操控性评估,后者用于部署后的监控。

关键词

引用

@article{arxiv.2604.17698,
  title  = {The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability},
  author = {Prashant C. Raju},
  journal= {arXiv preprint arXiv:2604.17698},
  year   = {2026}
}