中文

CAST:基于可靠置信度的表格数据聚类感知自训练方法

机器学习 2024-08-30 v3

摘要

表格数据是使用最广泛的数据模态之一,包含大量带有 substantial 未标记数据的数据库。尽管其普遍,在表格领域利用未标记数据的简单且通用的方法明显匮乏,而该领域同时采用梯度提升决策树与神经网络。在此背景下,自训练因其简单与通用而受到关注,但它易受由错误置信度导致的噪声伪标签影响。已有若干方案处理该问题,但往往牺牲了自训练的固有优势,导致在表格领域的适用性有限。为解决此问题,我们探索了自训练情境中可靠置信度的新方向,并得出结论:使代表伪标签价值的置信度与聚类假设对齐,可改进自训练。为此,我们提出面向表格数据的聚类感知自训练(CAST),以可忽略的代价增强现有自训练算法,同时保持简单与通用。具体而言,CAST 通过基于标记训练数据中每类的局部密度正则化分类器置信度来校准置信度,从而在低密度区域赋予伪标签更低置信度。在多达 21 个真实世界数据集上的广泛实证评估不仅证实了 CAST 的优越性能,也验证了其在自训练情境下多种设定中的鲁棒性。

关键词

引用

@article{arxiv.2310.06380,
  title  = {CAST: Cluster-Aware Self-Training for Tabular Data via Reliable Confidence},
  author = {Minwook Kim and Juseong Kim and Ki Beom Kim and Giltae Song},
  journal= {arXiv preprint arXiv:2310.06380},
  year   = {2024}
}

备注

11 pages for main body, and 10 additional pages for appendix