ViHOS:面向越南语的有害言论片段检测
计算与语言
2023-01-27 v2
摘要
针对其他用户的有害和攻击性语言的增多是社交网络平台使用增加带来的负面副作用之一。这可能使人工审核员难以审查由分类系统过滤出的已标记评论。为帮助解决此问题,我们提出了 ViHOS(越南语有害与攻击性片段,Vietnamese Hate and Offensive Spans)数据集,这是首个包含 11k 条评论中 26k 个片段的人工标注语料库。我们还给出了越南语评论中有害和攻击性片段的定义以及详细的标注指南。此外,我们使用多种最先进(state-of-the-art)模型进行了实验。具体而言,XLM-R 在单片段检测和全部片段检测中取得了最佳的 F1 分数,而 PhoBERT 在多片段检测中获得了最高分。最后,我们的错误分析展示了在未来研究中检测数据中特定类型片段的困难。免责声明:本文包含可能被视为亵渎、攻击性或辱骂性的真实评论。
引用
@article{arxiv.2301.10186,
title = {ViHOS: Hate Speech Spans Detection for Vietnamese},
author = {Phu Gia Hoang and Canh Duc Luu and Khanh Quoc Tran and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2301.10186},
year = {2023}
}
备注
EACL 2023