中文

ClassiNet——预测缺失特征以用于短文本分类

计算与语言 2018-04-17 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

短文本分类的根本问题是特征稀疏性——即训练好的模型与待分类测试实例之间缺乏特征重叠。我们提出 ClassiNet——一个由分类器组成的网络,训练用于预测给定实例中的缺失特征,以克服特征稀疏性问题。利用一组未标注的训练实例,我们首先学习二分类器作为特征预测器,用于预测给定实例中是否出现某一特定特征。接着,每个特征预测器表示为 ClassiNet 中的一个顶点 viv_i,特征预测器与顶点之间存在一一对应关系。连接顶点 viv_i 到顶点 vjv_j 的有向边 eije_{ij} 的权重表示条件概率:给定 viv_i 存在于某实例中,vjv_j 也存在于同一实例中。我们证明,ClassiNet 通过考虑特征间的隐式共现关系,推广了词共现图。我们从训练好的 ClassiNet 中提取大量特征以克服特征稀疏性。特别地,对于给定实例 x\vec{x},我们从 ClassiNet 中找出未在 x\vec{x} 中出现的相似特征,并将这些特征附加到 x\vec{x} 的表示中。此外,我们提出一种基于图传播的方法,以寻找与给定短文本间接相关的特征。我们在多个短文本分类基准数据集上评估 ClassiNet。实验结果表明,通过使用 ClassiNet,我们可以在短文本分类任务中统计显著地提高准确率,而无需使用任何外部资源(如同义词词典)来寻找相关特征。

关键词

引用

@article{arxiv.1804.05260,
  title  = {ClassiNet -- Predicting Missing Features for Short-Text Classification},
  author = {Danushka Bollegala and Vincent Atanasov and Takanori Maehara and Ken-ichi Kawarabayashi},
  journal= {arXiv preprint arXiv:1804.05260},
  year   = {2018}
}

备注

Accepted to ACM TKDD