以例为规:利用逻辑规则实现可解释仇恨言论检测
计算与语言
2023-07-25 v1 人工智能
摘要
经典的内容审核方法通常应用基于规则的启发式方法来标记内容。尽管规则易于定制且对人类直观可解释,但其天生脆弱,缺乏审核当今在线大量不良内容所需的灵活性或鲁棒性。深度学习的近期进展展示了使用高效深度神经模型克服这些问题的前景。然而,尽管性能提升,这些数据驱动模型缺乏透明性与可解释性,常导致普通用户的不信任以及许多平台的不采用。本文提出 Rule By Example(RBE):一种新颖的基于样例的对比学习方法,用于从逻辑规则中学习以完成文本内容审核任务。RBE 能够提供基于规则的预测,与典型深度学习方法是比,可实现更具可解释性与可定制性的预测。我们证明,该方法仅使用少量数据样例即可学习丰富的规则嵌入表示。在 3 个流行仇恨言论分类数据集上的实验结果表明,在有监督与无监督设定下,RBE 均能超越最先进的深度学习分类器以及规则的使用,同时通过规则依据提供可解释的模型预测。
引用
@article{arxiv.2307.12935,
title = {Rule By Example: Harnessing Logical Rules for Explainable Hate Speech Detection},
author = {Christopher Clarke and Matthew Hall and Gaurav Mittal and Ye Yu and Sandra Sajeev and Jason Mars and Mei Chen},
journal= {arXiv preprint arXiv:2307.12935},
year = {2023}
}
备注
ACL 2023 Main Conference