中文

通过理由提取实现零样本代码混合攻击性片段识别

计算与语言 2022-05-13 v1 机器学习

摘要

本文研究了句子级 transformer 在泰英代码混合数据集上零样本攻击性片段识别的有效性。更具体地,我们评估了局部可解释模型无关解释(LIME)\cite{DBLP:conf/kdd/Ribeiro0G16} 与积分梯度(IG)\cite{DBLP:conf/icml/SundararajanTY17} 这两种理由提取方法,用于将基于 transformer 的攻击性语言分类模型适配于零样本攻击性片段识别。为此,我们发现 LIME 与 IG 的基线 F1F_{1} 分别为 26.35% 与 44.83%。此外,我们研究了数据集规模与训练过程对片段识别总体准确率的影响。结果表明,经掩码数据增强与多标签训练后,LIME 与 IG 均有显著提升,其 F1F_{1} 分别为 50.23% 与 47.38%。\textit{免责声明:本文包含可能被视为亵渎、粗俗或攻击性的示例。这些示例不代表作者或其雇主/研究生院对任何个人、群体、行为或实体的观点,仅用于强调语言研究挑战。}

关键词

引用

@article{arxiv.2205.06119,
  title  = {Zero-shot Code-Mixed Offensive Span Identification through Rationale Extraction},
  author = {Manikandan Ravikiran and Bharathi Raja Chakravarthi},
  journal= {arXiv preprint arXiv:2205.06119},
  year   = {2022}
}

备注

Submission to https://dravidianlangtech.github.io/2022/