基于熵的大语言模型价值漂移与对齐工作度量
计算与语言
2025-12-04 v1 人工智能
机器学习
摘要
大语言模型安全性通常使用静态基准进行评估,但关键故障是动态的:在分布偏移下的价值漂移、越狱攻击以及部署中对齐的缓慢退化。基于一种近期的智能第二定律,该定律将伦理熵视为一个状态变量,在不被对齐工作抵消时倾向于增加,我们使这一框架适用于大语言模型。我们定义了一个五类行为分类法,训练一个分类器从模型转录中估计伦理熵 S(t),并在四个前沿模型的基础版本和指令微调版本的压力测试中测量熵动力学。基础模型表现出持续的熵增长,而微调变体抑制漂移并将伦理熵降低约百分之八十。从这些轨迹中,我们估计了有效的对齐工作率 gamma_eff,并将 S(t) 和 gamma_eff 嵌入一个监控流水线中,当熵漂移超过稳定性阈值时发出警报,从而实现对价值漂移的运行时监督。
引用
@article{arxiv.2512.03047,
title = {Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models},
author = {Samih Fadli},
journal= {arXiv preprint arXiv:2512.03047},
year = {2025}
}
备注
6 pages. Companion paper to "The Second Law of Intelligence: Controlling Ethical Entropy in Autonomous Systems". Code and tools: https://github.com/AerisSpace/EthicalEntropyKit