针对反亚裔仇恨的言论检测任务:BERT为核心,数据为中心研究是关键
计算与语言
2022-08-23 v2
摘要
随着COVID-19大流行持续,亚洲以外国家(尤其华人中)针对亚裔的仇恨正在加剧。迫切需要对针对亚裔的仇恨言论进行有效检测与预防。本工作中,我们首先创建了COVID-HATE-2022,一个包含2022年2月初获取的2025条标注推文的标注数据集,其依据特定标准标注,并给出了数据集中仇恨与非仇恨推文场景的全面收集。其次,我们基于相关数据集微调BERT模型,并展示了若干与推文“清洗”相关的策略。第三,我们研究了多种以模型为中心和以数据为中心的高级微调策略的性能,表明两类策略总体均提升性能,而以数据为中心的策略优于其他,并证明了以数据为中心的方法在相关任务中的可行性与有效性。
引用
@article{arxiv.2206.02114,
title = {Speech Detection Task Against Asian Hate: BERT the Central, While Data-Centric Studies the Crucial},
author = {Xin Lian},
journal= {arXiv preprint arXiv:2206.02114},
year = {2022}
}