中文

用于鲁棒文本分类的西卜变体变换

计算与语言 2022-05-12 v1 机器学习

摘要

NLP中绝大多数文本变换技术由于隐含地受限于保持原始类标签,在扩展输入空间覆盖能力方面固有地受限。本工作中,我们提出西卜变体(SIB)概念以描述放宽标签保持约束、可预知地改变预期类别并导致显著更多样输入分布的更广变换集合。我们提供一个统一框架来组织所有数据变换,包括两类SIB:(1)嬗变将一种离散类别转换为另一种;(2)混合突变将两种或更多类别混合在一起。为探索西卜变体在NLP中的作用,我们实现了41种文本变换,包含若干新技术如Concept2Sentence与SentMix。西卜变体还启用一种独特形式的自适应训练,为最易混淆的类对生成新输入混合,挑战学习器以更细微的差别进行区分。我们在六个基准数据集上的实验有力地支持了西卜变体在泛化性能、缺陷检测与对抗鲁棒性方面的有效性。

关键词

引用

@article{arxiv.2205.05137,
  title  = {Sibylvariant Transformations for Robust Text Classification},
  author = {Fabrice Harel-Canada and Muhammad Ali Gulzar and Nanyun Peng and Miryung Kim},
  journal= {arXiv preprint arXiv:2205.05137},
  year   = {2022}
}

备注

9 pages, Findings of ACL 2022