聚焦仇恨的多元性:一个基于特征的在线仇恨语料库
计算与语言
2022-04-29 v1
摘要
尽管在线仇恨言论(HS)在过去十年中是重要的研究对象,大多数 HS 相关语料库通过将用户评论标注为“仇恨”或“中立”而过度简化了仇恨现象。这忽略了 HS 复杂且主观的本质,限制了在这些语料库上训练的分类器的实际适用性。在本研究中,我们呈现 M-Phasis 语料库,一个从移民相关新闻文章收集的约 9k 条德语和法语用户评论的语料库。它超越了“仇恨”-“中立”的二分法,而是用 23 个特征进行标注,这些特征组合后成为从批评性评论到隐性与显性仇恨表达等各类言语的描述符。标注由每种语言 4 名母语者完成,并达到了高(0.77 <= k <= 1)的标注者间一致性。除了描述语料库创建并呈现来自内容、错误和领域分析的见解外,我们通过训练若干分类基线来探索其数据特征。
引用
@article{arxiv.2204.13400,
title = {Placing M-Phasis on the Plurality of Hate: A Feature-Based Corpus of Hate Online},
author = {Dana Ruiter and Liane Reiners and Ashwin Geet D'Sa and Thomas Kleinbauer and Dominique Fohr and Irina Illina and Dietrich Klakow and Christian Schemer and Angeliki Monnier},
journal= {arXiv preprint arXiv:2204.13400},
year = {2022}
}
备注
14 pages, 4 figures, accepted at LREC 2022 (Full Paper)