中文

利用本体提升大规模多标签预测模型的性能

机器学习 2019-05-30 v1 人工智能 机器学习

摘要

大规模多标签预测/分类问题出现在如医疗或生物学等环境中,其中非常精确的预测是有用的。大规模多标签问题的一个挑战是标签的频率分布常呈长尾,导致稀有标签的正例很少。我们提出一种解决方案:修改神经网络的输出层,创建一个 sigmoid 的贝叶斯网络,利用标签之间的本体关系来帮助在稀有标签与更常见标签之间共享信息。我们将此方法应用于疾病预测(ICD-9 代码)和蛋白质功能预测(基因本体术语)这两个大规模多标签任务,并在不常见标签的每标签 AUROC 和平均精度上获得了显著提升。

关键词

引用

@article{arxiv.1905.12126,
  title  = {Using Ontologies To Improve Performance In Massively Multi-label Prediction Models},
  author = {Ethan Steinberg and Peter J. Liu},
  journal= {arXiv preprint arXiv:1905.12126},
  year   = {2019}
}