通过理由提取实现零样本代码混合攻击性片段识别
计算与语言
2022-05-13 v1 机器学习
摘要
本文研究了句子级 transformer 在泰英代码混合数据集上零样本攻击性片段识别的有效性。更具体地,我们评估了局部可解释模型无关解释(LIME)\cite{DBLP:conf/kdd/Ribeiro0G16} 与积分梯度(IG)\cite{DBLP:conf/icml/SundararajanTY17} 这两种理由提取方法,用于将基于 transformer 的攻击性语言分类模型适配于零样本攻击性片段识别。为此,我们发现 LIME 与 IG 的基线 分别为 26.35% 与 44.83%。此外,我们研究了数据集规模与训练过程对片段识别总体准确率的影响。结果表明,经掩码数据增强与多标签训练后,LIME 与 IG 均有显著提升,其 分别为 50.23% 与 47.38%。\textit{免责声明:本文包含可能被视为亵渎、粗俗或攻击性的示例。这些示例不代表作者或其雇主/研究生院对任何个人、群体、行为或实体的观点,仅用于强调语言研究挑战。}
引用
@article{arxiv.2205.06119,
title = {Zero-shot Code-Mixed Offensive Span Identification through Rationale Extraction},
author = {Manikandan Ravikiran and Bharathi Raja Chakravarthi},
journal= {arXiv preprint arXiv:2205.06119},
year = {2022}
}
备注
Submission to https://dravidianlangtech.github.io/2022/