中文

SelfAug:通过分布自对齐缓解检索增强生成中的灾难性遗忘

计算与语言 2025-09-05 v1 人工智能

摘要

近期大型语言模型(LLM)的快速发展通过其在理解和执行多样任务方面的卓越能力,彻底变革了自然语言处理领域。尽管监督微调在检索增强生成(RAG)场景中能够有效提升任务特定性能,但往往会导致灾难性遗忘,即模型失去先前获取的知识和通用能力。现有方法要么需要获取通用指令数据,要么在保留模型原始分布方面存在局限。为克服这些限制,我们提出了 SelfAug,这是一种自分布对齐方法,通过对输入序列 logits 进行对齐来保存模型的语义分布,从而缓解灾难性遗忘并提升下游性能。大量实验表明,SelfAug 在下游学习与通用能力保留之间实现了卓越的平衡。我们的全面经验分析揭示了分布偏移与 RAG 场景下灾难性遗忘严重程度之间的直接相关性,突显了在没有 RAG 能力的通用指令调优情况下,微调期间发生的显著分布偏移。我们的发现不仅推进了对 RAG 场景下灾难性遗忘的理解,也提供了一个可适用于多种微调场景的实用解决方案。我们的代码已公开于 https://github.com/USTC-StarTeam/SelfAug。

关键词

引用

@article{arxiv.2509.03934,
  title  = {SelfAug: Mitigating Catastrophic Forgetting in Retrieval-Augmented Generation via Distribution Self-Alignment},
  author = {Yuqing Huang and Rongyang Zhang and Qimeng Wang and Chengqiang Lu and Yan Gao and Yi Wu and Yao Hu and Xuyang Zhi and Guiquan Liu and Xin Li and Hao Wang and Enhong Chen},
  journal= {arXiv preprint arXiv:2509.03934},
  year   = {2025}
}