ML-Net:基于深度神经网络的生物医学文本多标签分类
信息检索
2019-07-02 v2 计算与语言
机器学习
机器学习
摘要
在多标签文本分类中,每篇文本文档可被赋予一个或多个标签。由于这一特性,多标签文本分类任务通常被认为比二分类或多类文本分类问题更具挑战性。作为在生物医学中具有重要应用(如分配诊断编码)的任务,近年来已提出多种不同的计算方法(例如为每个标签训练并组合二分类器)。然而,许多方法准确率和效率有限,在实际应用中的成功十分有限。我们提出了一种新颖的深度学习框架 ML-Net,用于生物医学文本的多标签分类。作为一个端到端系统,ML-Net 将标签预测网络与自动标签数量预测机制相结合,通过利用每个标签的预测置信度分数和目标文档中的上下文信息,输出一组最优标签。我们在两类文本体裁——生物医学文献和临床笔记——上的三个独立公开语料库上对 ML-Net 进行了评估。评估中使用了基于样本的准确率、召回率和 F 值等度量。ML-Net 与多个有竞争力的机器学习基线模型进行了比较。我们的基准测试结果表明,在生物医学文本多标签分类方面,ML-Net 优于最先进的方法。ML-Net 在生物医学不同文本体裁上评估时也表现出鲁棒性。与传统的机器学习方法不同,ML-Net 不需要人工特征工程,并且对于具有大量标签的任务是一种高效且可扩展的方法(无需为每个单独标签构建分类器)。最后,ML-Net 能够以更系统且准确的方式基于文档上下文动态估计标签数量。
引用
@article{arxiv.1811.05475,
title = {ML-Net: multi-label classification of biomedical texts with deep neural networks},
author = {Jingcheng Du and Qingyu Chen and Yifan Peng and Yang Xiang and Cui Tao and Zhiyong Lu},
journal= {arXiv preprint arXiv:1811.05475},
year = {2019}
}