中文

通过表示差异性理解语言模型的内部机制

机器学习 2023-10-24 v1 人工智能 计算与语言

摘要

随着语言模型被应用于越来越多的现实世界应用,理解其内部机制已成为模型信任、可解释性与透明度中的重要问题。在本工作中,我们表明表示差异性度量——即衡量两个模型内部表示差异程度的函数——可成为洞悉语言模型机理的有价值工具。我们的洞见包括:(i) 使用 SoLU 与 GeLU 激活函数的模型内部表示存在明显不对称性;(ii) 证据表明差异性度量能够识别并定位模型泛化性质,而这些性质通过分布内测试集性能是不可见的;(iii) 关于语言模型特征如何随宽度与深度增加而变化的新的评估。我们的结果表明,差异性度量是揭示语言模型内部机制的一组有前景的工具。

关键词

引用

@article{arxiv.2310.14993,
  title  = {Understanding the Inner Workings of Language Models Through Representation Dissimilarity},
  author = {Davis Brown and Charles Godfrey and Nicholas Konz and Jonathan Tu and Henry Kvinge},
  journal= {arXiv preprint arXiv:2310.14993},
  year   = {2023}
}

备注

EMNLP 2023 (main)