中文

通过模型编辑提升大型语言模型语义一致性:一种解释性方法

计算与语言 2025-01-22 v1

摘要

大型语言模型(LLM)在面对语义等价但表述方式与原始提示不同的输入时,倾向于生成不一致或甚至矛盾的输出。要实现LLM的语义一致性,关键方法之一是使用语义等价含义的提示-输出对进行微调。尽管这种数据驱动的方法有效,但在数据准备和模型优化方面存在巨大的计算成本。在该方法中,LLM被视为一个“黑箱”,限制了我们深入了解其内部机制的能力。本文致力于通过更具解释性的方法(即模型编辑)来增强LLM的语义一致性。我们首先识别影响LLM语义一致性的关键模型组件(即注意力头),随后沿着语义一致性激活方向注入这些组件输出中的偏置。值得注意的是,这些修改成本效益高,不需要对原始模型参数进行大规模操作。通过在构建的NLU和开源NLG数据集上的大量实验,我们的方法在提升LLM的语义一致性和任务性能方面显示出显著的改进。此外,我们的方法在超越主要任务的任务上也表现出良好的泛化能力。

关键词

引用

@article{arxiv.2501.11041,
  title  = {Enhancing Semantic Consistency of Large Language Models through Model Editing: An Interpretability-Oriented Approach},
  author = {Jingyuan Yang and Dapeng Chen and Yajing Sun and Rongjun Li and Zhiyong Feng and Wei Peng},
  journal= {arXiv preprint arXiv:2501.11041},
  year   = {2025}
}