中文

大语言模型能否在不遗忘的情况下增量学习新概念?

机器学习 2024-06-19 v3 计算与语言

摘要

大语言模型(LLMs)在各种任务中取得了显著成功,然而其在不遗忘的情况下进行增量学习的能力仍未得到充分探索。增量学习(IL)至关重要,因为它使模型能够像人类学习一样,在保留先前所学信息的同时获取新知识。现有的 IL 基准测试由于数据泄露问题和 LLMs 的过度合格而显得不足。为应对这些挑战,我们引入了 Concept-1K,这是一个包含跨不同领域的 1,023 个新兴概念的新颖数据集。Concept-1K 中的概念是离散的、可解释的知识单元,允许对学习和遗忘过程进行细粒度分析。使用 Concept-1K 作为测试平台,我们旨在回答这个问题:“大语言模型能否像人类一样在不遗忘的情况下增量学习新概念?”我们的调查揭示,LLMs 仍然遭受灾难性遗忘,并且 LoRA 尽管微调了更少的参数,却可能导致训练数据上更多的遗忘。此外,我们探索了上下文学习、模型规模、缓冲区大小和预训练在 IL 性能中的作用。这些发现突出了 LLMs 在 IL 场景中的优势与局限性,并为未来研究提供了稳健的基准。

关键词

引用

@article{arxiv.2402.08526,
  title  = {Can LLMs Learn New Concepts Incrementally without Forgetting?},
  author = {Junhao Zheng and Shengjie Qiu and Qianli Ma},
  journal= {arXiv preprint arXiv:2402.08526},
  year   = {2024}
}

备注

28 pages