t-SS3:一种基于动态n-gram、面向文本流早期风险检测的文本分类器
计算与语言
2020-07-14 v2 信息检索
机器学习
摘要
一种称为SS3的近期提出的分类器已被证明非常适合处理文本流上的早期风险检测(ERD)问题。它在CLEF的eRisk开放任务中于Reddit上的早期抑郁和厌食症检测上取得了最先进的性能。SS3的创建天然适用于ERD问题,因为:它支持在文本流上进行增量训练和分类,并且可以可视化解释其推理依据。然而,SS3使用词袋模型处理输入,缺乏识别重要词序列的能力。这一方面可能对分类性能产生负面影响,也降低了视觉解释的描述性。在标准文档分类领域,非常常见地使用词n-gram来尝试克服部分此类局限。遗憾的是,在处理文本流时,使用n-gram并非易事,因为系统必须“即时”学习并识别哪些n-gram是重要的。本文介绍t-SS3,即SS3的扩展,使其能够在文本流上动态识别有用模式。我们在eRisk 2017和2018任务的早期抑郁和厌食症检测上评估了我们的模型。实验结果表明,t-SS3能够同时改进当前结果和视觉解释的丰富性。
引用
@article{arxiv.1911.06147,
title = {t-SS3: a text classifier with dynamic n-grams for early risk detection over text streams},
author = {Sergio G. Burdisso and Marcelo Errecalde and Manuel Montes-y-Gómez},
journal= {arXiv preprint arXiv:1911.06147},
year = {2020}
}
备注
Highlights: (*) A classifier that is able to dynamically learn and recognize important word n-grams. (*) A novel text classifier having the ability to visually explain its rationale. (*) Support for incremental learning and text classification over streams. (*) Efficient model for addressing early risk detection problems