在标注数据稀缺约束下改进开放世界持续学习
机器学习
2025-07-29 v2 人工智能
摘要
开放世界持续学习(OWCL)适应带有开放样本的序列任务,在学习知识的同时防止遗忘。然而,现有的 OWCL 仍需要大量标注数据进行训练,这在实际应用中通常不可行。鉴于新类别/实体通常带有有限的标注且数量稀少,一种更现实的情况是标注数据稀缺的 OWCL,即少训练样本。因此,本文研究了开放世界少样本持续学习(OFCL)问题,其挑战在于: 在不遗忘先前知识且避免过拟合的情况下学习无界任务; 在标注数据有限的情况下为开放检测构建紧凑的决策边界; 转移关于已知和未知的知识,甚至在获知开放样本的标签后将未知更新为已知。作为回应,我们提出了一种新颖的 OFCL 框架,该框架集成了三个关键组件: 实例级词元增强(ITA),通过额外知识表示并丰富样本表征; 基于边界的开放边界(MOB),支持随着新任务随时间出现而进行开放检测; 自适应知识空间(AKS),赋予未知知识以实现从未知到已知的更新。最后,大量实验表明,所提出的 OFCL 框架以重要的实用价值和可复现性显著优于所有基线。源代码发布于 https://github.com/liyj1201/OFCL。
引用
@article{arxiv.2502.20974,
title = {Improving Open-world Continual Learning under the Constraints of Scarce Labeled Data},
author = {Yujie Li and Xiangkun Wang and Xin Yang and Marcello Bonsangue and Junbo Zhang and Tianrui Li},
journal= {arXiv preprint arXiv:2502.20974},
year = {2025}
}
备注
Accepted by KDD2025 (February Cycle)