通过非欧几里得距离层重新思考调和损失
机器学习
2026-04-30 v3 人工智能
摘要
交叉熵损失长期以来是深度神经网络训练的标准选择,但其存在可解释性受限、权重无界增长以及可能导致昂贵训练动力学的效率问题。调和损失是一种基于欧几里得几何的距离损失,提升了可解释性并缓解了如“grokking”即指在测试集上延迟泛化等现象。然而,调和损失的研究仍较狭窄:仅探讨欧几里得距离,且未系统评估其计算效率或可持续性。我们通过系统性地探讨作为欧几里得距离替代方案的广泛距离度量谱,扩展了调和损失。我们在视觉主干网络和大语言模型上全面评估了距离定制化调和损失。我们的分析围绕模型性能、可解释性和可持续性三方面展开。在视觉任务中,余弦距离在准确率提升和碳排放降低之间提供了最佳的权衡收益,而布雷-Curtis距离和马哈努里斯距离在不同效率成本下进一步提升了可解释性。在语言模型中,基于余弦的调和损失改善了梯度和学习稳定性,强化了表示结构,同时相对于交叉熵和欧几里得头减少了排放。我们的代码已公开:https://anonymous.4open.science/r/rethinking-harmonic-loss-5BAB/。
引用
@article{arxiv.2603.10225,
title = {Rethinking the Harmonic Loss via Non-Euclidean Distance Layers},
author = {Maxwell Miller-Golub and Collin Coil and Kamil Faber and Marcin Pietron and Panpan Zheng and Pasquale Minervini and Roberto Corizzo},
journal= {arXiv preprint arXiv:2603.10225},
year = {2026}
}