中文

谐和损失训练可解释的人工智能模型

机器学习 2025-07-11 v2

摘要

本文介绍了谐和损失作为训练神经网络和大型语言模型(LLM)的替代监督信号。谐和损失与标准交叉熵损失不同,具体体现在:(a) 用尺度不变的HarMax函数取代常用的SoftMax归一化;(b) 通过欧几里得距离计算逻辑值,而非点积。由于其尺度不变性及其设计上的有限收敛点(可解释为类中心),谐和损失实现了更好的可解释性和更快的收敛速度。我们首先在算法、视觉和语言数据集上验证了谐和模型的性能。通过大量实验,证明使用谐和损失训练的模型相较于标准模型在以下方面表现更佳:(a) 提升可解释性;(b) 所需数据量更少即可实现泛化;(c) 降低grokking现象。此外,我们将使用谐和损失训练的GPT-2模型与标准GPT-2模型进行比较,说明谐和模型更易develop出可解释的表示。展望未来,我们认为谐和损失可能成为数据有限或在高风险应用中需要可解释性和可靠性的领域的宝贵工具,为更稳健和高效的神经网络模型铺平道路。

关键词

引用

@article{arxiv.2502.01628,
  title  = {Harmonic Loss Trains Interpretable AI Models},
  author = {David D. Baek and Ziming Liu and Riya Tyagi and Max Tegmark},
  journal= {arXiv preprint arXiv:2502.01628},
  year   = {2025}
}

备注

21 pages, 14 figures; The first two authors contributed equally