仅从相关关键词与无标签文档中学习
计算与语言
2019-10-31 v2 机器学习
机器学习
摘要
我们考虑一个文档分类问题,其中文档标签缺失,仅给定目标类别的相关关键词与无标签文档。尽管基于伪标签的启发式方法已被考虑,但该问题的理论理解仍然有限。此外,先前的方法难以轻易纳入有监督文本分类中成熟的技术。在本文中,我们提出一个理论保证的学习框架,其实现简单且对模型(如线性模型或神经网络)有灵活选择。我们展示了如何有效优化受试者工作特征曲线下面积(AUC),并讨论如何调整以优化其他知名评估指标如准确率与 F1-measure。最后,我们使用基准数据集展示了我们框架的有效性。
引用
@article{arxiv.1910.04385,
title = {Learning Only from Relevant Keywords and Unlabeled Documents},
author = {Nontawat Charoenphakdee and Jongyeong Lee and Yiping Jin and Dittaya Wanvarie and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1910.04385},
year = {2019}
}
备注
EMNLP-IJCNLP2019, fix typos in Theorem 1: change $\pi$ and $\pi'$ to $\theta$ and $\theta'$