中文

KE-QI:一个知识增强的文章质量识别数据集

计算与语言 2022-08-25 v3

摘要

随着每时每刻都有大量质量参差不齐的文章产生,筛选出优秀文章并推送到社交媒体是一项十分紧迫的任务。据我们所知,目前在高质量文章识别方面缺乏数据集和成熟的研究工作。为此,我们进行了一些调研,最终确定了7个客观指标来对1万篇文章的质量进行标注。在标注过程中,我们发现高质量文章的许多特征(如背景)更多依赖于广泛的外部知识而非文章内部语义信息。为此,我们将抽取的文章实体链接到百度百科,进而提出了知识增强的文章质量识别(KE-QI)数据集。为了更好地利用外部知识,我们提出了一种复合模型,通过门控单元融合文本与外部知识信息来对文章质量进行分类。在KE-QI上的实验结果表明,以我们预训练的Node2Vec模型初始化,我们的模型取得了约78%的F1F_1,优于其他基线方法。

关键词

引用

@article{arxiv.2206.07556,
  title  = {KE-QI: A Knowledge Enhanced Article Quality Identification Dataset},
  author = {Chunhui Ai and Derui Wang and Xu Yan and Yang Xu and Wenrui Xie and Ziqiang Cao},
  journal= {arXiv preprint arXiv:2206.07556},
  year   = {2022}
}