社交媒体中攻击性语言的识别与分类
计算与语言
2021-04-13 v1 社会与信息网络
摘要
攻击性语言在社交媒体中十分普遍。个体常利用计算机中介交流 perceived 的匿名性,从事许多人在现实生活中不会考虑的行为。在线攻击性内容的自动识别是一项重要任务,近年来受到更多关注。该任务可建模为监督分类问题,其中系统使用包含按某种(些)滥用或攻击性内容存在性标注的帖子的数据集进行训练。本研究的目的是描述为 SemEval-2019 Task 6: OffensEval 构建的分类系统。该系统将推文分类为攻击性或非攻击性(子任务 A),并进一步将攻击性推文分类为若干类别(子任务 B 与 C)。我们训练了机器学习与深度学习模型,并结合数据预处理与采样技术以取得最佳结果。讨论的模型包括朴素贝叶斯、SVM、逻辑回归、随机森林与 LSTM。
引用
@article{arxiv.2104.04871,
title = {Identifying and Categorizing Offensive Language in Social Media},
author = {Nikhil Oswal},
journal= {arXiv preprint arXiv:2104.04871},
year = {2021}
}