中文

玩具模型中的单语义性工程化

机器学习 2022-11-18 v1 人工智能

摘要

在某些神经网络中,单个神经元对应于输入中自然的“特征”。此类单语义神经元对可解释性研究极有帮助,因为它们可被清晰理解。本工作中,我们报告了在玩具模型中工程化单语义性的初步尝试。我们发现,仅通过改变训练过程所落入的局部极小值,便可在不增加损失的情况下使模型更具单语义性。更具单语义性的损失极小值具有中等程度的负偏置,我们能够利用这一事实来工程化高度单语义的模型。我们得以对这些模型进行机制性解释,包括剩余的复语义神经元,并揭示了一个简单却令人惊讶的算法。最后,我们发现为模型每层提供更多的神经元可使模型更具单语义性,尽管计算代价有所增加。这些发现指向了工程化单语义性的若干新问题与新途径,我们拟在 future 工作中加以研究。

关键词

引用

@article{arxiv.2211.09169,
  title  = {Engineering Monosemanticity in Toy Models},
  author = {Adam S. Jermyn and Nicholas Schiefer and Evan Hubinger},
  journal= {arXiv preprint arXiv:2211.09169},
  year   = {2022}
}

备注

31 pages, 26 figures