用于大语言模型精准大规模编辑的分层正交残差扩散
计算与语言
2026-01-19 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 在各个领域展现出卓越的性能,但面临着关键的安全性问题。模型编辑已成为缓解这些问题的一种有效方法。现有的模型编辑方法通常专注于优化一个融合新旧知识的信息矩阵。虽然这些方法有效,但它们计算成本高昂且可能引发冲突。相反,我们将注意力转向信息矩阵的分层正交残差扩散,这从不同角度降低了噪声梯度并实现了更稳定的编辑。我们通过与其他几种流行方法的清晰理论比较,以及在多个 LLM 上跨两个数据集进行的大量实验,证明了我们的方法 HORSE 的有效性。结果表明,HORSE 在多种场景下均能保持精准的大规模编辑。代码可在 https://github.com/XiaojieGu/HORSE 获取。
引用
@article{arxiv.2601.11441,
title = {Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models},
author = {Xiaojie Gu and Guangxu Chen and Yuheng Yang and Jingxin Han and Andi Zhang},
journal= {arXiv preprint arXiv:2601.11441},
year = {2026}
}
备注
ICASSP 2026