中文

AILA——局部化语言模型的首次实验

计算与语言 2025-11-06 v1 人工智能

摘要

本文首次展示了 transformer 语言模型中可控局部化的实证研究,提出一种新型架构框架,通过可调的局部性拨轮参数实现对表示局部化程度的连续控制。不同于传统语言模型完全依赖分布式表示,本方法允许在高度可解释的局部编码与高效分布式表示之间进行动态插值,而无需模型重新训练。我们在 WikiText 语料库上采用两层 transformer 架构,系统性地在局部性参数 {\lambda} 从 1.0(完全局部)到 0.0(完全分布)的整个范围内进行变换。实验结果表明,局部配置显著降低注意力熵,{\lambda} = 1.0 时为 5.36 位,而{\lambda} = 0.0 时为 7.18 位;同时保持 substantially higher 的指针保真度得分,反映出与规则指定目标的更强对齐。预测实验揭示,中间局部性值在可解释性与性能之间实现最佳权衡,{\lambda} = 0.6 时测试困惑度为 4.65,准确率为 84.7%。这些发现表明,局部化语言模型为需要同时具备透明度与能力的受监管领域提供了实用框架,通过明确的惩罚阈值和信息论设计原则,对可解释性-性能谱线实现精确的数学控制。

关键词

引用

@article{arxiv.2511.03559,
  title  = {AILA--First Experiments with Localist Language Models},
  author = {Joachim Diederich},
  journal= {arXiv preprint arXiv:2511.03559},
  year   = {2025}
}