DAFNet:面向大语言模型顺序模型编辑的动态辅助融合网络
计算与语言
2024-06-03 v1
摘要
最近,尽管大语言模型(LLM)已展现出惊人的性能,但仍存在幻觉问题,即生成虚假信息。模型编辑是纠正 LLM 中事实错误的任务;然而,大多数前期工作将其视为一次性任务,很少关注由 LLM 持续生成的错误。我们 addressed 顺序模型编辑(SME)任务,以持续纠正错误。设计了一个动态辅助融合网络(DAFNet),以增强事实知识在整个序列中的语义交互,防止编辑多个知识三元组过程中的灾难性遗忘。具体而言:(1)对于关系三元组内的语义融合,我们将 intra-editing 注意力流聚合到基于标记的自注意力中,采用 LLM 中的自回归自注意力。我们进一步利用多层对角线 inter-editing 注意力流来更新整个序列级粒度的加权表示。(2)考虑到需要存储顺序编辑知识的辅助参数,我们构建了一个名为 DAFSet 的新数据集,满足 recent、popular、long-tail 和 robust 等属性,以增强顺序编辑的通用性。实验表明,DAFNet 在单轮和顺序编辑中均显著优于强大的基线方法。DAFSet 的使用也在 various 场景中持续改善了其他基于辅助网络的方法的性能。
引用
@article{arxiv.2405.20588,
title = {DAFNet: Dynamic Auxiliary Fusion for Sequential Model Editing in Large Language Models},
author = {Taolin Zhang and Qizhou Chen and Dongyang Li and Chengyu Wang and Xiaofeng He and Longtao Huang and Hui Xue and Jun Huang},
journal= {arXiv preprint arXiv:2405.20588},
year = {2024}
}
备注
ACL2024 findings