基于主动学习查询的累积元学习框架用于对抗虚假关联
机器学习
2026-05-21 v1
摘要
现实数据集中的虚假关联会导致机器学习模型依赖于不相关模式,从而损害可靠性、泛化能力和公平性。主动学习是一个有前景的解决方法,通过查询区分核心特征与虚假特征的有信息样本。然而,标准主动学习方法仅简单地将查询样本追加到已标记集合中,实际上仅更新似然项。在深度学习中,这些有信息样本的影响可能被较大的已标记集合所稀释,并且被过参数化模型记忆。我们提出累积主动元学习 (CAML),一种使用查询样本来元学习先验(即归纳偏置)的主动学习框架,以控制模型如何适应。CAML 将每个主动学习轮次作为元学习任务:当前已标记集合作为元训练数据进行适应,而新查询的批次作为元测试数据用于评估泛化。不同于常规元学习将任务视为独立同分布,CAML 通过保持累积归纳偏置来利用主动学习轮次之间的序列依赖性,该偏置被逐步细化。理论上,我们表明这种累积表述引入的相互作用项将早期元学习归纳偏置与后续查询诱导目标耦合,捕捉到常规元学习中缺失的依赖。实验上,CAML 在虚假关联基准测试中提升了少数群体准确率,分别在 Dominoes 上提升 27.8%,Waterbirds 上提升 29.9%,SpuCo 上提升 14.3%,CivilComments 上提升 24.0%。
引用
@article{arxiv.2605.20771,
title = {Cumulative Meta-Learning from Active Learning Queries for Robustness to Spurious Correlations},
author = {Kin Whye Chew and Jingxian Wang},
journal= {arXiv preprint arXiv:2605.20771},
year = {2026}
}
备注
Under review. 26 pages, 7 figures