无逆变 Wilson 环量化 Transformer:用于检验不变性与顺序敏感性的实用诊断工具
机器学习
2025-10-13 v1 人工智能
摘要
大型语言模型在无害编辑下会产生变化的答案,这些变化在实际应用中却至关重要:RAG 输出在段落重新排序后会翻转,微调会消解预训练时学到的不变性,辩论或链式思考提示会采取路径依赖的路线,编译融合或重新排序会扰动决策边界附近的 logits。这些失败违反了预期的不变性,破坏了持续集成,迫使团队在安全性与速度之间做出权衡。这些效应虽小,却分布在各层和位置,受上下文长度和评估顺序的敏感,修复代价高昂,需要重新训练或形式化验证。我们提出了 WILSON,一套最小化的后置诊断套件,将内部表示上的简单循环和重新排序检查转换为系统信号。WILSON 结合了基于 JVP 和 Hutchinson 探针计算的对位置和层的无逆变曲率图,以及用于标记重新排序风险的激活级换位符。信号计算廉价、对标准 Transformer 模型agnostic, 可导出为阈值和 CSV 构件供编排器使用。这使得具体行动成为可能:防御 RAG 免受顺序效应的影响,捕捉微调退归,稳定辩论路径和长期多轮上下文, 并在部署时对融合或重新排序进行门控。总之,WILSON 帮助预测失败并批准安全优化,使可靠性和吞吐量能够在不改变模型体系结构或训练的前提下实现同步提升。
引用
@article{arxiv.2510.08648,
title = {Inverse-Free Wilson Loops for Transformers: A Practical Diagnostic for Invariance and Order Sensitivity},
author = {Edward Y. Chang and Ethan Y. Chang},
journal= {arXiv preprint arXiv:2510.08648},
year = {2025}
}
备注
24 pages, 10 figures, 2 tables