ClassiNet——预测缺失特征以用于短文本分类
计算与语言
2018-04-17 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
短文本分类的根本问题是特征稀疏性——即训练好的模型与待分类测试实例之间缺乏特征重叠。我们提出 ClassiNet——一个由分类器组成的网络,训练用于预测给定实例中的缺失特征,以克服特征稀疏性问题。利用一组未标注的训练实例,我们首先学习二分类器作为特征预测器,用于预测给定实例中是否出现某一特定特征。接着,每个特征预测器表示为 ClassiNet 中的一个顶点 ,特征预测器与顶点之间存在一一对应关系。连接顶点 到顶点 的有向边 的权重表示条件概率:给定 存在于某实例中, 也存在于同一实例中。我们证明,ClassiNet 通过考虑特征间的隐式共现关系,推广了词共现图。我们从训练好的 ClassiNet 中提取大量特征以克服特征稀疏性。特别地,对于给定实例 ,我们从 ClassiNet 中找出未在 中出现的相似特征,并将这些特征附加到 的表示中。此外,我们提出一种基于图传播的方法,以寻找与给定短文本间接相关的特征。我们在多个短文本分类基准数据集上评估 ClassiNet。实验结果表明,通过使用 ClassiNet,我们可以在短文本分类任务中统计显著地提高准确率,而无需使用任何外部资源(如同义词词典)来寻找相关特征。
引用
@article{arxiv.1804.05260,
title = {ClassiNet -- Predicting Missing Features for Short-Text Classification},
author = {Danushka Bollegala and Vincent Atanasov and Takanori Maehara and Ken-ichi Kawarabayashi},
journal= {arXiv preprint arXiv:1804.05260},
year = {2018}
}
备注
Accepted to ACM TKDD