利用 Tsetlin 机文本分类器的合取子句度量自然语言文本的新颖性
计算与语言
2020-11-18 v1 人工智能
机器学习
摘要
大多数有监督文本分类方法假设一个封闭世界,指望训练时数据中所有类别均存在。这一假设在运行过程中出现新颖的、先前未见的类别时,可能导致不可预测的行为。尽管基于深度学习的方法近来已被用于新颖性检测,但由于其黑盒性质,它们难以解释。本文探讨可解释的开放世界文本分类,其中训练好的分类器必须在运行时处理新颖类别。为此,我们为最近提出的 Tsetlin 机(TM) 扩展了一种新颖性评分机制。该机制利用 TM 的合取子句来度量文本与训练数据所覆盖类别的匹配程度。我们证明这些子句提供了已知主题的简洁可解释描述,并且我们的评分机制使得能够将新颖主题与已知主题区分开来。在实证上,我们的基于 TM 的方法在五个数据集中的三个上优于其他七种新颖性检测方案,并在其余数据集中分别取得第二和第三好的性能,且附带基于可解释命题逻辑表示的额外优势。
引用
@article{arxiv.2011.08755,
title = {Measuring the Novelty of Natural Language Text Using the Conjunctive Clauses of a Tsetlin Machine Text Classifier},
author = {Bimal Bhattarai and Ole-Christoffer Granmo and Lei Jiao},
journal= {arXiv preprint arXiv:2011.08755},
year = {2020}
}
备注
10 pages, 5 figures, 3 tables