中文

IRepair:面向意图的大语言模型数据驱动错误修复方法

计算与语言 2025-03-12 v3 人工智能 软件工程

摘要

大语言模型(LLM)以不断惊人之作备受关注,同时也因其面临的挑战而被广泛讨论。LLM对数据集中的偏见极其敏感,导致诸如毒性等问题。虽然已采用域自适应训练来缓解这些问题,但这些技术常对模型的所有参数样样贴心处理,导致修复质量不佳且模型通用性下降。本文引入一种 novel 基于动态切片的意图感知LLM修复策略,即IRepair。该方法有针对性地修复模型中最易出错的部分。具体而言,我们提出对模型最敏感的层进行动态切片,集中修复力量于这些区域。此方法通过改变模型较小比例的部分,实现更有效的修复,可能对模型整体性能影响更小。我们在来自GPT2和GPT-Neo系列的三个模型(参数规模从8亿至16亿)上进行评估,进行毒性缓解实验。我们的实验表明,IRepair在修复错误方面比最近的基线——直接偏好优化——更有效43.6%,同时对通用性能的干扰减少46%。我们的实证分析还揭示,错误在模型的较小区域中更集中,top 20%的层比其余80%的层拥有773%更高的错误密度。这凸显了有针对性修复的必要性。此外,我们证明了动态选择方法对于处理模型中分布式错误至关重要,确保了修复的稳健性和效率。

关键词

引用

@article{arxiv.2502.07072,
  title  = {IRepair: An Intent-Aware Approach to Repair Data-Driven Errors in Large Language Models},
  author = {Sayem Mohammad Imtiaz and Astha Singh and Fraol Batole and Hridesh Rajan},
  journal= {arXiv preprint arXiv:2502.07072},
  year   = {2025}
}

备注

Accepted as full research paper at FSE'2025