CurLL:面向语言模型的发展框架以评估持续学习
计算与语言
2025-10-16 v1 人工智能
摘要
我们提出了一个基于 5-10 岁人类发展轨迹的全面持续学习数据集和基准测试 (CurlL),以系统性、细粒度地评估模型 progressively 获取新技能的能力。CurlL 覆盖 5 个发展阶段 (0-4),对应 5-10 岁,配合技能图谱将广泛技能分解为更小的技能、具体目标和可衡量指标,同时捕捉哪些技能依赖其他技能。我们生成了 234 亿 token 的合成数据集,控制技能进度、词汇复杂度和格式多样性,包含段落、基于理解的问答 (CQA)、技能测试问答 (CSQA) 和指令-响应 (IR) 对。阶段性 token 数量范围从 21.2 亿到 67.8 亿,支持精确分析遗忘、前向迁移和后向迁移。使用 1.35 亿参数的 transformer 在独立、联合和顺序 (持续) 训练 setup 下,我们展示了技能保留和迁移效率之间的权衡。通过模拟人类学习模式并提供对技能依赖关系的细粒度控制,该工作推动了语言模型持续学习评估的发展。
引用
@article{arxiv.2510.13008,
title = {CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models},
author = {Pavan Kalyan and Shubhra Mishra and Satya Lokam and Navin Goyal},
journal= {arXiv preprint arXiv:2510.13008},
year = {2025}
}