中文

当不变表示学习遇到标签偏移:不足与理论洞见

机器学习 2024-06-25 v1 计算机视觉与模式识别

摘要

作为迈向环境变化的现实学习场景的关键一步,数据集偏移理论和不变表示学习算法已被广泛研究,以放宽经典学习设置中的同分布假设。在关于偏移本质的不同假设中,广义标签偏移(GLS)是最近发展起来的,显示出处理偏移中复杂因素的巨大潜力。在本文中,我们旨在探索当前数据集偏移理论和算法的局限性,并通过全面理解 GLS 提供新的见解。在理论方面,我们推导了两个有信息量的泛化界,并从贝叶斯角度证明了 GLS 学习器足够接近最优目标模型。主要结果表明了不变表示学习的不足,并证明了 GLS 校正对于泛化的充分性和必要性,这为在数据集偏移下探索可泛化模型提供了理论支持和创新。在方法方面,我们提供了现有偏移校正框架的统一视角,并提出了一种基于核嵌入的校正算法(KECA),以最小化泛化误差并实现成功的知识迁移。理论结果和广泛的实验评估都证明了 GLS 校正在解决数据集偏移问题上的充分性和必要性,以及所提出算法的优越性。

关键词

引用

@article{arxiv.2406.16608,
  title  = {When Invariant Representation Learning Meets Label Shift: Insufficiency and Theoretical Insights},
  author = {You-Wei Luo and Chuan-Xian Ren},
  journal= {arXiv preprint arXiv:2406.16608},
  year   = {2024}
}

备注

Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)