中文

大语言模型修复的样本选择策略实证研究

机器学习 2025-10-24 v1

摘要

大型语言模型(LLM)越来越多地部署在现实系统中,但它们可能产生有毒或有偏见的输出,从而损害安全性和信任。事后模型修复提供了一种实用的补救措施,但参数更新的高成本促使选择性地使用修复数据。尽管在模型训练的数据选择方面已有大量先前研究,但针对大型生成模型的行为修复,哪些采样标准最有效和高效仍不清楚。我们的研究对 LLM 修复的样本优先级策略进行了系统分析。我们评估了五种代表性选择方法,包括随机采样、K-Center、基于梯度范数的选择(GraNd)、分层覆盖(CCS),以及我们提出的语义感知优先采样(SAPS)方法。通过毒性降低、WikiText-2 和 LAMBADA 上的困惑度,以及三个复合指标——修复邻近度得分(RPS)、总体性能得分(OPS)和修复效率得分(RES)——评估修复效果和权衡。实验结果表明,SAPS 在解毒、效用保持和效率之间取得了最佳平衡,以更少的数据实现了可比或更优的修复结果。随机采样对大型或鲁棒模型仍然有效,而 CCS 和 GraNd 等高开销方法提供的益处有限。最优数据比例取决于模型规模和修复方法,表明样本选择应被视为修复流水线中的可调组件。总体而言,这些发现确立了基于选择的修复作为一种高效且可扩展的范式,用于维护 LLM 可靠性。

关键词

引用

@article{arxiv.2510.20428,
  title  = {An Empirical Study of Sample Selection Strategies for Large Language Model Repair},
  author = {Xuran Li and Jingyi Wang},
  journal= {arXiv preprint arXiv:2510.20428},
  year   = {2025}
}