基于神经正-无标记学习的文档集扩展的可扩展评估与改进
计算与语言
2021-01-18 v2 机器学习
摘要
我们考虑如下情形:用户已收集了一小组关于某一凝聚主题(cohesive topic)的文档,并希望从大型集合中检索该主题的额外文档。信息检索(IR)解决方案将该文档集视为查询,并在集合中寻找相似文档。我们提议将 IR 方法扩展,将问题视为正-无标记(PU)学习的一个实例——即仅从正类与无标记数据中学习二分类器,其中正类数据对应于查询文档,无标记数据为 IR 引擎返回的结果。将 PU 学习用于大型神经网络的文本处理在很大程度上是一个未充分探索的领域。我们讨论了将 PU 学习应用于该设置的各种挑战,包括未知类别先验、极度不平衡数据以及模型的大规模精确评估,并提出了解决方案且经实证验证。我们利用一系列检索遵循细粒度主题的 PubMed 摘要实验证明了该方法的有效性。我们展示了相对于基础 IR 解决方案及其他基线的改进。
引用
@article{arxiv.1910.13339,
title = {Scalable Evaluation and Improvement of Document Set Expansion via Neural Positive-Unlabeled Learning},
author = {Alon Jacovi and Gang Niu and Yoav Goldberg and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1910.13339},
year = {2021}
}
备注
Accepted as a long paper to EACL 2021