中文

基于正例-无标签学习的文档集扩展:一种密度估计方法

机器学习 2024-01-23 v1 信息检索

摘要

文档集扩展旨在基于一小部分属于细粒度主题的文档,从大型文档集中识别出相关文档。先前的工作表明,PU 学习是完成此任务的一种有前景的方法。然而,一些严重的问题仍未解决,即 PU 方法面临的典型挑战,如未知类先验和数据不平衡,以及直推式实验设置的需求。在本文中,我们提出了一种基于密度估计的新型 PU 学习框架,称为 puDE,可以处理上述问题。puDE 的优势在于它既不受 SCAR 假设的约束,也不需要任何类先验知识。我们使用一系列真实世界数据集证明了所提方法的有效性,并得出结论:我们的方法是 DSE 任务的更好替代方案。

关键词

引用

@article{arxiv.2401.11145,
  title  = {Document Set Expansion with Positive-Unlabeled Learning: A Density Estimation-based Approach},
  author = {Haiyang Zhang and Qiuyi Chen and Yuanjie Zou and Yushan Pan and Jia Wang and Mark Stevenson},
  journal= {arXiv preprint arXiv:2401.11145},
  year   = {2024}
}