以火攻火:利用大规模生成式仇恨言论样本微调仇恨检测器
计算与语言
2021-09-03 v1 人工智能
摘要
自动仇恨言论检测受限于标注数据集的稀缺,导致泛化性能不佳。我们采用预训练语言模型(LMs)来缓解这一数据瓶颈。我们利用 GPT 语言模型从已有的标注样本中生成大量合成仇恨言论序列,并在仇恨检测任务中利用生成的数据对大型预训练语言模型进行微调。基于 BERT、RoBERTa 和 ALBERT 模型的实证研究表明,该方法在相同或不同数据分布下均能显著且稳定地提升泛化能力。事实上,我们发现生成相关的标注仇恨言论序列优于使用域外、有时甚至是域内的人工标注样本。
引用
@article{arxiv.2109.00591,
title = {Fight Fire with Fire: Fine-tuning Hate Detectors using Large Samples of Generated Hate Speech},
author = {Tomer Wullach and Amir Adler and Einat Minkov},
journal= {arXiv preprint arXiv:2109.00591},
year = {2021}
}
备注
Accepted to Findings of ACL: EMNLP 2021