中文

MedCL-Bench:医学持续学习中的稳定性-效率权衡与规模评估

人工智能 2026-03-18 v1

摘要

医学语言模型必须随证据和术语演进而更新,但顺序更新可能引发灾难性遗忘。尽管医学 NLP 拥有许多静态基准,却不存在用于评估在标准化协议下进行持续学习、对任务顺序鲁棒性和计算感知报告的统一、任务多样化基准。我们引入 MedCL-Bench,通过流式十个医学 NLP 数据集(跨五个任务家族)评估十一种持续学习策略,涵盖八种任务顺序,报告保留率、迁移率和 GPU 小时成本。在各种 backbone 和任务顺序下,顺序直接微调会导致灾难性遗忘,引起先前任务的性能退步。持续学习方法在保留-计算边界上呈现出不同特征:参数隔离提供每 GPU 小时的保留率最佳,重放在更高成本下提供强力保护,而正则化仅提供有限的益处。遗忘具有任务依赖性,多标签主题分类最脆弱,而受限输出任务更稳健。MedCL-Bench 提供了一个可复现的框架,用于在部署前审计模型更新。

关键词

引用

@article{arxiv.2603.16738,
  title  = {MedCL-Bench: Benchmarking stability-efficiency trade-offs and scaling in biomedical continual learning},
  author = {Min Zeng and Shuang Zhou and Zaifu Zhan and Rui Zhang},
  journal= {arXiv preprint arXiv:2603.16738},
  year   = {2026}
}