中文

面向 PU 学习的解耦表示学习

机器学习 2023-10-09 v1

摘要

本文中,我们解决给定正类与未标记数据(通常称为 PU 学习)的二分类(正类 vs. 负类)器学习问题。尽管聚类、分布外检测或正类密度估计等初级技术可用于在低维设置下解决该问题,但由于数据分布复杂性增加,其效力随维度升高而逐渐恶化。本文我们提出使用基于损失函数的神经网络数据表示学习,可将未标记数据投影为两个(正类与负类)簇,可使用简单聚类技术轻松识别,有效模拟低维设置中观察到的现象。我们采用向量量化技术对所学表示进行放大,以增强所学未标记数据簇间的分离。我们在模拟 PU 数据上开展实验,证明所提方法相较当前最先进方法的性能提升。我们也对基于双簇的方法及算法选择提供了一些理论依据。

关键词

引用

@article{arxiv.2310.03833,
  title  = {Learning A Disentangling Representation For PU Learning},
  author = {Omar Zamzam and Haleh Akrami and Mahdi Soltanolkotabi and Richard Leahy},
  journal= {arXiv preprint arXiv:2310.03833},
  year   = {2023}
}