抽取式对抗网络:用于识别社交媒体帖子中人身攻击的高召回解释
计算与语言
2018-10-23 v2 信息检索
机器学习
机器学习
摘要
我们引入一种对抗方法,用于生成神经文本分类器决策的高召回解释。基于已有的通过硬注意力实现抽取式解释的架构,我们增加了一个对抗层,用于扫描注意力残差中剩余的预测信号。受检测社交媒体评论中人身攻击这一重要领域的启发,我们进一步展示了通过显式操控偏置项来手动设定模型在语义上恰当的“默认”行为的重要性。我们构建了一个人工标注人身攻击的验证集,以评估这些改动的影响。
引用
@article{arxiv.1809.01499,
title = {Extractive Adversarial Networks: High-Recall Explanations for Identifying Personal Attacks in Social Media Posts},
author = {Samuel Carton and Qiaozhu Mei and Paul Resnick},
journal= {arXiv preprint arXiv:1809.01499},
year = {2018}
}
备注
Accepted to EMNLP 2018 Code and data available at https://github.com/shcarton/rcnn