检测有毒内容以改善在线对话
计算与语言
2019-11-05 v1 人工智能
机器学习
摘要
社交媒体充斥着有毒内容。本文旨在构建一个能够检测不真诚问题的模型。我们使用“Quora 不真诚问题分类”数据集进行分析。该数据集由真诚与不真诚问题组成,其中真诚问题占多数。使用 Python 及其库(如 sklearn、numpy、pandas、keras 等)对数据集进行处理和分析。使用 GloVe、Wiki-news 和 TF-IDF 等词嵌入将数据集转换为向量形式。通过重采样技术处理数据集中的不平衡问题。我们训练并比较了多种机器学习和深度学习模型以得出最佳结果。讨论的模型包括 SVM、Naive Bayes、GRU 和 LSTM。
引用
@article{arxiv.1911.01217,
title = {Detect Toxic Content to Improve Online Conversations},
author = {Deepshi Mediratta and Nikhil Oswal},
journal= {arXiv preprint arXiv:1911.01217},
year = {2019}
}