中文

LAG-XAI:基于仿射几何框架的可解释 Transformer 隐层 paraphrasing

计算与语言 2026-04-08 v1 人工智能

摘要

现代基于 Transformer 的语言模型在自然语言处理任务中取得了强大的性能,但其潜在语义空间仍然是大多数不可解释的黑盒子。这篇论文引入了 LAG-XAI(Lie Affine Geometry for Explainable AI),一种新颖的几何框架,将 paraphrasing 不建模为离散的词替换,而是作为嵌入空间中的结构仿射变换。通过将 paraphrasing 概念为语义流形上的连续几何流,我们提出了受局部 Lie 群作用启发的计算高效的均值场近似。这允许我们将 paraphrase 转换分解为几何可解释的组成部分:旋转、变形和平移。在编码使用 Sentence-BERT 的噪声 PIT-2015 Twitter 语料库上的实验中,发现了“线性透明性”现象。所提出的仿射算子实现了 AUC 为 0.7713 的性能。通过对抗随机机会(AUC 0.5)进行归一化,模型捕获了约 80% 的非线性基线有效分类容量(AUC 0.8405),在绝对准确率略有下降的同时提供了显式的参数可解释性。该模型识别了基本几何不变量,包括约 27.84{\deg} 的稳定矩阵重新配置角度和接近零的变形,表明局部等距性。通过在独立 TURL 数据集上的直接跨语料库验证确认了跨域泛化。进一步地,LAG-XAI 的实际用途在于 LLM 幻觉检测:该模型通过注册超出可允许语义走廊的偏差,自动检测了 HaluEval 数据集上 95.3% 的事实性扭曲。该方法提供了一条在 Transformer 方面实现机制性可解释性的、数学上有据可取且资源高效的路径。

关键词

引用

@article{arxiv.2604.06086,
  title  = {LAG-XAI: A Lie-Inspired Affine Geometric Framework for Interpretable Paraphrasing in Transformer Latent Spaces},
  author = {Olexander Mazurets and Olexander Barmak and Leonid Bedratyuk and Iurii Krak},
  journal= {arXiv preprint arXiv:2604.06086},
  year   = {2026}
}