使用 Tsetlin 机学习人类可解释规则以实现高准确率文本分类及其医学应用
机器学习
2018-09-18 v2 机器学习
摘要
医学应用对当今文本分类技术提出挑战,要求同时具备高准确率与易解释性。尽管深度学习在准确率上实现了飞跃,但这一飞跃以牺牲可解释性为代价。为应对这一准确率-可解释性挑战,我们在此首次引入一种利用近期提出的 Tsetlin 机的文本分类方法。简言之,我们将文本的术语表示为命题变量。由此,我们使用简单命题公式捕获类别,例如:若“皮疹”且“反应”且“青霉素”则为过敏。Tsetlin 机从带标签文本中学习这些公式,利用合取子句表示每一类别的特定方面。事实上,即便是术语的缺失(否定特征)也可用于分类目的。我们与朴素贝叶斯、决策树、线性支持向量机(SVM)、随机森林、长短期记忆(LSTM)神经网络及其他方法的经验比较颇具说服力。Tsetlin 机在 20 Newsgroups 与 IMDb 数据集以及一份非公开临床数据集上,表现与所有评估方法相当或优于它们。平均而言,Tsetlin 机在各数据集上取得最佳召回率与精确率分数。最后,我们对 Tsetlin 机的 GPU 实现比 CPU 实现快 5 至 15 倍,取决于数据集。因此我们相信,我们的新方法可对广泛的文本分析应用产生显著影响,构成利用 Tsetlin 机进行更深自然语言理解的有前景起点。
引用
@article{arxiv.1809.04547,
title = {Using the Tsetlin Machine to Learn Human-Interpretable Rules for High-Accuracy Text Categorization with Medical Applications},
author = {Geir Thore Berge and Ole-Christoffer Granmo and Tor Oddbjørn Tveit and Morten Goodwin and Lei Jiao and Bernt Viggo Matheussen},
journal= {arXiv preprint arXiv:1809.04547},
year = {2018}
}
备注
10 pages, 4 figures