通过表示差异性理解语言模型的内部机制
机器学习
2023-10-24 v1 人工智能
计算与语言
摘要
随着语言模型被应用于越来越多的现实世界应用,理解其内部机制已成为模型信任、可解释性与透明度中的重要问题。在本工作中,我们表明表示差异性度量——即衡量两个模型内部表示差异程度的函数——可成为洞悉语言模型机理的有价值工具。我们的洞见包括:(i) 使用 SoLU 与 GeLU 激活函数的模型内部表示存在明显不对称性;(ii) 证据表明差异性度量能够识别并定位模型泛化性质,而这些性质通过分布内测试集性能是不可见的;(iii) 关于语言模型特征如何随宽度与深度增加而变化的新的评估。我们的结果表明,差异性度量是揭示语言模型内部机制的一组有前景的工具。
引用
@article{arxiv.2310.14993,
title = {Understanding the Inner Workings of Language Models Through Representation Dissimilarity},
author = {Davis Brown and Charles Godfrey and Nicholas Konz and Jonathan Tu and Henry Kvinge},
journal= {arXiv preprint arXiv:2310.14993},
year = {2023}
}
备注
EMNLP 2023 (main)