利用依赖语法与图卷积网络进行细粒度攻击性语言检测
计算与语言
2022-05-27 v1 机器学习
摘要
过去几年中,社交媒体上攻击性文本的传播呈指数级增长。高精度识别此类文本对社会的福祉至关重要。现有方法大多倾向于给无害语句(例如“我是一名男同性恋者”)打出高毒性分数。这些假阳性源于训练数据上的过度泛化,其中语句中的特定术语可能曾以贬义方式使用(例如“gay”)。仅强调此类词语可能导致对这类系统旨在保护的群体的歧视。在本文中,我们解决 Twitter 上攻击性语言检测的问题,同时检测攻击的类型与目标。我们提出一种称为 SyLSTM 的新方法,利用图卷积网络将句子的依赖解析树形式句法特征与词嵌入形式语义特征整合进深度学习架构。结果表明,所提方法以少几个数量级的参数量显著优于 SOTA 的 BERT 模型。
引用
@article{arxiv.2205.13164,
title = {Leveraging Dependency Grammar for Fine-Grained Offensive Language Detection using Graph Convolutional Networks},
author = {Divyam Goel and Raksha Sharma},
journal= {arXiv preprint arXiv:2205.13164},
year = {2022}
}
备注
10 pages, 2 figures, accepted as a long paper at The 10th International Workshop on Natural Language Processing for Social Media (SocialNLP @ NAACL 2022)