短回看下的半监督漂移流学习
机器学习
2022-05-27 v1
摘要
在许多场景中,1) 数据流实时生成;2) 标注数据昂贵且初始仅有少量标签可用;3) 真实世界数据并非总是独立同分布,且数据随时间逐渐漂移;4) 历史流的存储有限,模型更新只能基于极短的回看窗口完成。该学习设定限制了众多机器学习(ML)算法的适用性与可用性。我们将此设定下的学习任务泛化为短回看半监督漂移流学习问题(SDSL)。SDSL 对半监督学习、连续学习和域适应中的现有方法提出了两个未被充分应对的挑战:1) 渐进漂移下的鲁棒伪标注;2) 短回看下的抗遗忘适应。为应对这些挑战,我们提出一个原则性且通用的生成-重放框架来解决 SDSL。该框架能够完成:1) 生成步骤中的鲁棒伪标注;2) 重放步骤中的抗遗忘适应。为实现鲁棒伪标注,我们开发了一种新颖的伪标注分类模型,以利用先前标注数据的监督知识、新数据的无监督知识以及不变标签语义的结构知识。为实现自适应抗遗忘模型重放,我们提出将抗遗忘适应任务视为平坦区域搜索问题。我们提出一种新颖的基于极小极大博弈的重放目标函数来解决平坦区域搜索问题,并开发了有效的优化求解器。最后,我们给出了大量实验,证明我们的框架能有效解决短回看漂移流中的抗遗忘学习任务。
引用
@article{arxiv.2205.13066,
title = {Semi-supervised Drifted Stream Learning with Short Lookback},
author = {Weijieying Ren and Pengyang Wang and Xiaolin Li and Charles E. Hughes and Yanjie Fu},
journal= {arXiv preprint arXiv:2205.13066},
year = {2022}
}
备注
To appear in KDD 2022