中文

在线辩论的黄金标准摘要及面向在线辩论数据自动摘要的初步实验

计算与语言 2017-08-16 v1 人工智能 信息检索

摘要

在线文本媒体的使用正在稳步增加。每天都有越来越多的新闻报道、博客文章和科学文章被添加到在线资源库中。这些内容均可免费访问,并已被广泛应用于多个研究领域,例如自动文本摘要、信息检索、信息抽取等。与此同时,在线辩论论坛最近变得流行起来,但在很大程度上仍未被探索。因此,目前没有足够的带标注辩论数据资源可供进行该体裁的研究。在本文中,我们收集并标注了用于自动摘要任务的辩论数据。类似于抽取式黄金标准摘要的生成,我们的数据包含值得纳入摘要的句子。五位人工标注员执行了此任务。基于语义相似性的标注者间一致性,Cohen's kappa 为 36%,Krippendorff's alpha 为 48%。此外,我们还实现了一个针对在线辩论的抽取式摘要系统,并讨论了自动摘要在线辩论数据任务中的显著特征。

关键词

引用

@article{arxiv.1708.04592,
  title  = {Gold Standard Online Debates Summaries and First Experiments Towards Automatic Summarization of Online Debate Data},
  author = {Nattapong Sanchan and Ahmet Aker and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:1708.04592},
  year   = {2017}
}

备注

accepted and presented at the CICLING 2017 - 18th International Conference on Intelligent Text Processing and Computational Linguistics