中文

孟加拉语文档讽刺的自动检测:基于混合特征提取模型的 CNN 方法

信息检索 2019-12-02 v1 计算与语言 机器学习

摘要

讽刺性新闻在在线社区中的广泛传播是一种持续趋势。讽刺的本质如此固有地模糊,以至于有时甚至人类也很难理解其是否确为讽刺。因此该领域研究兴趣渐增。本研究旨在检测在线新闻门户及社交媒体中传播的孟加拉语讽刺新闻。本文中,我们提出一种结合 Word2Vec 与 TF-IDF 从文本文档提取特征的混合技术。使用我们提出的特征提取技术,借助标准 CNN 架构,我们能以超过 96% 的准确率检测孟加拉语文本文档是否为讽刺。

关键词

引用

@article{arxiv.1911.11062,
  title  = {Automatic Detection of Satire in Bangla Documents: A CNN Approach Based on Hybrid Feature Extraction Model},
  author = {Arnab Sen Sharma and Maruf Ahmed Mridul and Md Saiful Islam},
  journal= {arXiv preprint arXiv:1911.11062},
  year   = {2019}
}

备注

5 pages, Conference paper