中文

平衡合成数据与重放以提升任务特定能力

机器学习 2025-10-15 v1 计算与语言

摘要

通过持续预训练适应新任务的语言模型面临一个根本性权衡:模型必须学习新能力,同时避免对现有知识的灾难性遗忘。虽然已有研究探讨了合成数据生成技术,但在计算资源受限的情况下,如何权衡任务性能与知识保留的最优重放比例仍不明了。我们进行了一项全面的实证研究,考察重放比例配置与计算预算之间的相互作用,同时针对语言模型适应新任务。我们以bAbI推理任务为目标任务,应用合成数据生成方法,并系统评估不同的总token预算和重放比例配置。我们分析了这些配置对任务掌握程度和通用知识保留程度的影响。我们的实验揭示了一种在任务特定性能与通用知识保留之间取得平衡的最优配置。基于我们的发现,我们提供了基于计算预算选择重放比例的实证依据,使实践者能够以显著降低的训练成本实现强大的任务适应能力。

关键词

引用

@article{arxiv.2510.11842,
  title  = {Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities},
  author = {Urs Spiegelhalter and Jörg K. H. Franke and Frank Hutter},
  journal= {arXiv preprint arXiv:2510.11842},
  year   = {2025}
}

备注

Presented at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Continual and Compatible Foundation Model Updates (CCFM)