语言模型中的置信度调节神经元
机器学习
2024-11-11 v2 人工智能
计算与语言
摘要
尽管大语言模型(LLM)广泛应用于实际应用,但其在下一词预测中代表和调节不确定性的机制仍鲜有探索。本研究 investigates两种被认为影响这种不确定性的关键组件:最近发现的熵神经元以及我们 newly identified 的一组称为标记频率神经元的组件。熵神经元以异常高的权重范数为特征,影响最终层归一化(LayerNorm)比例,以有效放大 logits。我们的工作表明,熵神经元通过写入解绑零空间来发挥作用,从而以最小对 logits 本身直接影响的程度影响残差流范数。我们观察到在多达70亿参数的模型中均存在熵神经元。另一方面,标记频率神经元是我们首次发现并描述的组件,通过按其对数频率比例放大或抑制每个标记的 logits,从而将输出分布向或远离单词作�分布移动。最后,我们提出了详细的案例研究,展示熵神经元在 induction 场景下主动管理置信度,即检测并继续重复子序列。
引用
@article{arxiv.2406.16254,
title = {Confidence Regulation Neurons in Language Models},
author = {Alessandro Stolfo and Ben Wu and Wes Gurnee and Yonatan Belinkov and Xingyi Song and Mrinmaya Sachan and Neel Nanda},
journal= {arXiv preprint arXiv:2406.16254},
year = {2024}
}
备注
NeurIPS 2024