中文

基于PU学习中聚类假设的特征选择

机器学习 2025-04-18 v1 神经与进化计算

摘要

特征选择是高效数据挖掘的关键步骤,常遇到的情形是仅有少量正标签,而大部分数据 remains unlabeled。在某些实际PU学习任务中,经过充分特征选择后的数据往往形成具有集中正标签的聚类。在此情况下,常规特征选择方法将unlabeled数据视为负样本,可能无法捕捉正数据统计特征,导致性能次优。为此,我们提出一种基于PU学习中聚类假设的新型特征选择方法,称为FSCPU。FSCPU将特征选择问题形式化为二元优化任务,其目标函数显式地纳入PU学习设置下的聚类假设。合成数据集实验表明,FSCPU在各种数据条件下均有效。此外,与在三个公开数据集上比较10种常规算法的结果表明,FSCPU即使在聚类假设不严格成立时,也在下游分类任务中实现了具竞争力的性能。

关键词

引用

@article{arxiv.2504.12651,
  title  = {Feature selection based on cluster assumption in PU learning},
  author = {Motonobu Uchikoshi and Youhei Akimoto},
  journal= {arXiv preprint arXiv:2504.12651},
  year   = {2025}
}

备注

Accepted at GECCO 2025