中文

论源筛选在学习共享特征提取器中的威力

机器学习 2026-03-10 v2

摘要

使用共享表示的学习被广泛认为是跨各种异质源分离共性与异质性的有效方法。大多数现有工作通过同时训练一个共同的特征提取器和特定于源的头部来包含所有相关的数据源。众所周知,相关性低或质量差的数据源可能会阻碍表示学习。在本文中,我们通过关注传统上被认为是“良好”的源集合,进一步深入探讨了哪些数据源应该被联合学习的问题,在这个集合中,各个源相对于真实底层共同结构具有相似的相关性和质量。为了易于处理,我们专注于源共享一个低维子空间的线性设置。我们发现源筛选可以在统计最优子空间估计中发挥核心作用。我们表明,对于一大类问题实例,即使丢弃了相当一部分数据,在精心选择的源子集上进行训练也足以达到极小极大最优性。我们形式化了信息性子群体的概念,开发了识别此类子集的算法和实用启发式方法,并通过理论分析以及在合成和真实世界数据集上的实证评估验证了其有效性。

关键词

引用

@article{arxiv.2602.16125,
  title  = {On the Power of Source Screening for Learning Shared Feature Extractors},
  author = {Leo Muxing Wang and Connor Mclaughlin and Lili Su},
  journal= {arXiv preprint arXiv:2602.16125},
  year   = {2026}
}