中文

文本数据增强:面向鱼叉式钓鱼邮件的更好检测

计算与语言 2021-03-26 v2 信息检索 机器学习

摘要

文本数据增强,即从已有文本创建新文本,是一项具有挑战性的任务。事实上,增强变换在考虑语言复杂性的同时,还需与目标任务(如机器翻译、文本分类)相关。最初受商业电子邮件欺诈(BEC)检测应用的启发,我们提出了一种与语料库和任务无关的增强框架,作为服务用于在公司内部增强英文文本。我们的方案结合了多种方法,利用 BERT 语言模型、多步回译以及启发式规则。我们表明,使用公开可用的模型与语料库,以及在 BEC 检测任务上,我们的增强框架均能提升若干文本分类任务的性能。我们还就自身增强框架的局限性给出了详尽论证。

关键词

引用

@article{arxiv.2007.02033,
  title  = {Text Data Augmentation: Towards better detection of spear-phishing emails},
  author = {Mehdi Regina and Maxime Meyer and Sébastien Goutal},
  journal= {arXiv preprint arXiv:2007.02033},
  year   = {2021}
}