生成对抗网络在线仇恨言论的反叙事:数据与策略
计算与语言
2020-04-10 v1 计算机与社会
社会与信息网络
摘要
近来,研究开始关注在处理网络仇恨时避免内容审核带来的不良后果,如审查与过度屏蔽。其核心思想是直接在讨论中以旨在反击仇恨内容并防止其进一步传播的文本回应进行干预。相应地,诸如自然语言生成等自动化策略正开始被研究。然而,它们仍受限于高质量数据量的不足,且倾向于产生通用/重复性的回应。意识到上述局限,我们提出一项关于如何有效收集对仇恨的回应的研究,采用GPT-2等大规模无监督语言模型生成silver数据,以及可用于专家验证/后编辑前数据过滤的最佳标注策略/神经架构。
引用
@article{arxiv.2004.04216,
title = {Generating Counter Narratives against Online Hate Speech: Data and Strategies},
author = {Serra Sinem Tekiroglu and Yi-Ling Chung and Marco Guerini},
journal= {arXiv preprint arXiv:2004.04216},
year = {2020}
}
备注
To appear at ACL 2020 (long paper)