中文

用于快速响应 COVID-19 文本分类的正则表达式

计算与语言 2021-06-22 v4 机器学习 社会与信息网络

摘要

文本分类器是许多 NLP 应用的核心,并使用各种算法方法和软件。本文介绍了基于大规模正则表达式的文本分类器的基础设施和方法。特别地,我们描述了 Facebook 如何判定一段给定文本——从标签到帖子任意形式——是否属于如 COVID-19 这样的窄主题。为了完整定义一个主题并评估分类器性能,我们采用人工引导的关键词发现迭代,但不需要标注数据。对于 COVID-19,我们构建了两组正则表达式:(1) 针对 66 种语言,精度 99% 且召回率 >50%,(2) 针对 11 种最常见语言,精度 >90% 且召回率 >90%。正则表达式支持来自多平台的低延迟查询。对如 COVID-19 等挑战的响应是快速的,修订也是如此。与 DNN 分类器的比较显示出可解释的结果、更高的精度和召回率以及更少的过拟合。我们的经验可应用于其他窄主题分类器。

关键词

引用

@article{arxiv.2102.09507,
  title  = {Regular Expressions for Fast-response COVID-19 Text Classification},
  author = {Igor L. Markov and Jacqueline Liu and Adam Vagner},
  journal= {arXiv preprint arXiv:2102.09507},
  year   = {2021}
}

备注

10 pages, 7 tables