中文

利用域外分类改进在线讨论的无监督神经方面抽取

计算与语言 2020-06-18 v1

摘要

基于自注意力的深度学习架构近期在无监督方面抽取与主题建模任务上取得并超越了最先进(state of the art)结果。尽管诸如基于神经注意力的方面抽取(ABAE)等模型已成功应用于用户生成文本,但当应用于新闻文章与新闻组文档等传统数据源时,其连贯性较差。在本工作中,我们引入一种基于句子过滤的简单方法,以在不修改 ABAE 基本机制的前提下,改进从基于新闻组的内容中学到的主题方面。我们训练一个概率分类器以区分域外文本(外部数据集)与域内文本(目标数据集)。随后,在数据准备阶段,我们过滤掉属于域内概率较低的句子,并在剩余句子上训练神经模型。与在未经滤文本上训练的方面抽取模型相比,句子过滤对主题连贯性的积极作用得到了证明。

关键词

引用

@article{arxiv.2006.09766,
  title  = {Improving unsupervised neural aspect extraction for online discussions using out-of-domain classification},
  author = {Anton Alekseev and Elena Tutubalina and Valentin Malykh and Sergey Nikolenko},
  journal= {arXiv preprint arXiv:2006.09766},
  year   = {2020}
}

备注

Journal of Intelligent & Fuzzy Systems, pre-press, https://content.iospress.com/articles/journal-of-intelligent-and-fuzzy-systems/ifs179908