诊断性仇恨言论分类:人类与机器的分歧及其原因
计算与语言
2024-11-27 v2 计算机与社会
机器学习
摘要
本研究使用余弦相似度比率、embedding 回归和 manual 重新标注来诊断仇恨言论分类。我们首先在包含 135,556 条社交媒体注释评论的数据集上计算余弦相似度比率,从而展示余弦相似度作为仇恨言论内容描述的基本用途。随后,我们从理解数据集中人类注释不一致性开始诊断仇恨言论分类。使用 embedding 回归作为基本诊断,我们发现 female 标注者对针对 black 民族的种族辱骂词更敏感。我们采用训练仇恨言论分类器的方法,使用 SoTA 预训练大型语言模型 NV-Embed-v2 将文本转换为 embeddings 并运行 logistic 回归。该分类器在测试上的准确率达到 94%。在诊断机器与人类标注者不同步的地方时,我们发现机器比人类犯错更少,尽管人类注释被视为训练集中的 ground truth。机器在正确标记长篇事实陈述方面表现更好,但在标记短句辱骂词方面表现更差。我们推断这是由于模型对齐 - 在模型创建过程中规范化模型可防止其产生明显的仇恨言论,同时也降低了其检测此类内容的能力。
引用
@article{arxiv.2410.10153,
title = {Diagnosing Hate Speech Classification: Where Do Humans and Machines Disagree, and Why?},
author = {Xilin Yang},
journal= {arXiv preprint arXiv:2410.10153},
year = {2024}
}