中文

检测有毒内容以改善在线对话

计算与语言 2019-11-05 v1 人工智能 机器学习

摘要

社交媒体充斥着有毒内容。本文旨在构建一个能够检测不真诚问题的模型。我们使用“Quora 不真诚问题分类”数据集进行分析。该数据集由真诚与不真诚问题组成,其中真诚问题占多数。使用 Python 及其库(如 sklearn、numpy、pandas、keras 等)对数据集进行处理和分析。使用 GloVe、Wiki-news 和 TF-IDF 等词嵌入将数据集转换为向量形式。通过重采样技术处理数据集中的不平衡问题。我们训练并比较了多种机器学习和深度学习模型以得出最佳结果。讨论的模型包括 SVM、Naive Bayes、GRU 和 LSTM。

关键词

引用

@article{arxiv.1911.01217,
  title  = {Detect Toxic Content to Improve Online Conversations},
  author = {Deepshi Mediratta and Nikhil Oswal},
  journal= {arXiv preprint arXiv:1911.01217},
  year   = {2019}
}