梯度路由:屏蔽梯度以在神经网络中局部化计算
机器学习
2024-12-02 v2 人工智能
摘要
神经网络的训练主要基于其输入输出,忽略其内部机制。而这些被忽略的机制决定了对于安全性至关重要的属性:(i) 可解释性;(ii) 缺乏敏感信息或有害能力;(iii) 能否可靠地在训练分布之外推广目标。为此,本文引入梯度路由(gradient routing)一种训练方法,将能力局部化到神经网络的特定子区域。梯度路由在反向传播期间对梯度施加数据依赖的加权掩码。这些掩码由用户提供,以配置哪些参数由哪些数据点更新。我们表明,梯度路由可用于(1)学习以可解释方式划分的表示;(2)通过消除预指定网络子区域实现稳健的不可忘记;(3)通过局部分组负责不同行为的模块,实现对强化学习者的可扩展监督。总体而言,我们发现梯度路由即使仅应用于数据集的有限、粗略子集,也能局部化网络能力。我们得出结论,该方法在数据稀缺的实际应用场景中具有潜力。
引用
@article{arxiv.2410.04332,
title = {Gradient Routing: Masking Gradients to Localize Computation in Neural Networks},
author = {Alex Cloud and Jacob Goldman-Wetzler and Evžen Wybitul and Joseph Miller and Alexander Matt Turner},
journal= {arXiv preprint arXiv:2410.04332},
year = {2024}
}