中文

利用 BERT、CRF 与维基百科检测新闻中的潜在主题

计算与语言 2020-03-02 v2

摘要

对于像 Dailyhunt 这样的新闻内容分发平台,命名实体识别是构建更优用户推荐与通知算法的关键任务。除了从新闻中识别 13 种以上印度语言的姓名、地点、组织并用于算法外,我们还需要识别不一定符合命名实体定义却十分重要的 n-gram。例如“me too movement”“beef ban”“alwar mob lynching”。在此工作中,给定英文文本,我们试图检测传达重要信息并可用作新闻主题和/或标签的不区分大小写的 n-gram。模型使用维基百科标题数据、私有英文新闻语料库以及 BERT-Multilingual 预训练模型、Bi-GRU 和 CRF 架构构建。在 F1 尤其是召回率方面,与业界最佳的 Flair、Spacy 和 Stanford-caseless-NER 相比,它展现出有前景的结果。

关键词

引用

@article{arxiv.2002.11402,
  title  = {Detecting Potential Topics In News Using BERT, CRF and Wikipedia},
  author = {Swapnil Ashok Jadhav},
  journal= {arXiv preprint arXiv:2002.11402},
  year   = {2020}
}

备注

6 pages, 5 tables, 1 figure, 2 examples. This is a report based on applied research work conducted at Dailyhunt