中文

真的吗?嗯。显然自举法提升了在线对话中讽刺与恶意分类器的性能

计算与语言 2017-08-30 v1

摘要

网络上的信息越来越多地以对话形式呈现,从Facebook新闻推送、论坛讨论到新闻文章的评论串。与传统独白式的自然语言处理资源(如新闻)相比,高度社交化的对话在社交媒体中非常普遍,这给自然语言处理带来了挑战。本文测试了一种最初在独白领域提出的自举方法,用于训练分类器识别对话中两种不同类型的主观语言:讽刺和恶意。我们探索了两种开发语言指标的方法,这些指标用于第一级分类器,旨在以牺牲召回率为代价最大化精确率。第一阶段表现最佳的分类器对讽刺话语的精确率达到54%,召回率达到38%。然后,我们使用先前工作中的通用句法模式来创建更通用的讽刺指标,将精确率提高到62%,召回率提高到52%。为了进一步测试该方法的通用性,我们将其应用于自举一个用于恶意对话行为的分类器。我们的第一阶段使用众包的恶意指标,实现了58%的精确率和49%的召回率,当使用通用句法模式在第一级上进行自举后,精确率提高到75%,召回率提高到62%。

关键词

引用

@article{arxiv.1708.08572,
  title  = {Really? Well. Apparently Bootstrapping Improves the Performance of Sarcasm and Nastiness Classifiers for Online Dialogue},
  author = {Stephanie Lukin and Marilyn Walker},
  journal= {arXiv preprint arXiv:1708.08572},
  year   = {2017}
}

备注

Workshop on Language Analysis in Social Media (LASM 2013), at the North American Chapter of the Association for Computational Linguistics (NAACL 2013)