中文

GeoLAN:大语言模型中潜在解释方向的几何学习

机器学习 2026-03-23 v1 计算几何

摘要

大语言模型(LLM)表现出强大的性能,但常缺乏透明度。我们引入 GeoLAN,一种将 token 表示视为几何轨迹并应用受 Kakeya 猜想最新进展启发的黏性条件的训练框架。我们开发了两种可微分正则化器,Katz-Tao 凸锥Wolff(KT-CW)和 Katz-Tao 注意力(KT-Attn),以促进各向同性并鼓励多样化注意力。我们使用 Gemma-3(1B、4B、12B)和 Llama-3-8B进行实验,表明 GeoLAN 在保持任务准确率的同时,常常改善几何指标并减少某些公平性偏见。这些收益在中等规模模型中最为显著。我们的发现揭示了几何精度与性能之间的规模相关的权衡,表明几何感知训练是提高机制可解释性的有前景的方法。

关键词

引用

@article{arxiv.2603.19460,
  title  = {GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models},
  author = {Tianyu Bell Pan and Damon L. Woodard},
  journal= {arXiv preprint arXiv:2603.19460},
  year   = {2026}
}