更大的编辑批次大小总是更好吗?——基于 Llama-3 的模型编辑实证研究
计算与语言
2024-05-02 v1 人工智能
机器学习
摘要
本研究提出了针对最新大型语言模型 Llama-3 的定向模型编辑分析。我们探索了流行的模型编辑技术——ROME、MEMIT 和 EMMET 的有效性,这些技术专为精确的层级干预而设计。我们通过一项涵盖多达 4096 次编辑的评估,针对三种不同策略:顺序编辑、批次编辑以及我们称之为顺序-批次编辑的混合方法,确定了进行定向编辑的最有效层。我们的发现表明,在相同编辑次数下,增大编辑批次大小可能比顺序使用较小的编辑批次更严重地降低模型性能。基于此,我们认为顺序模型编辑是扩展模型编辑方法的重要组成部分,未来的研究应关注结合批次编辑和顺序编辑的方法。这一观察结果指出了当前推动更大编辑批次大小的模型编辑方法的潜在局限性,我们希望它能为未来优化批次大小和模型编辑性能的研究铺平道路。
引用
@article{arxiv.2405.00664,
title = {Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3},
author = {Junsang Yoon and Akshat Gupta and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2405.00664},
year = {2024}
}