文本数据增强:面向鱼叉式钓鱼邮件的更好检测
计算与语言
2021-03-26 v2 信息检索
机器学习
摘要
文本数据增强,即从已有文本创建新文本,是一项具有挑战性的任务。事实上,增强变换在考虑语言复杂性的同时,还需与目标任务(如机器翻译、文本分类)相关。最初受商业电子邮件欺诈(BEC)检测应用的启发,我们提出了一种与语料库和任务无关的增强框架,作为服务用于在公司内部增强英文文本。我们的方案结合了多种方法,利用 BERT 语言模型、多步回译以及启发式规则。我们表明,使用公开可用的模型与语料库,以及在 BEC 检测任务上,我们的增强框架均能提升若干文本分类任务的性能。我们还就自身增强框架的局限性给出了详尽论证。
引用
@article{arxiv.2007.02033,
title = {Text Data Augmentation: Towards better detection of spear-phishing emails},
author = {Mehdi Regina and Maxime Meyer and Sébastien Goutal},
journal= {arXiv preprint arXiv:2007.02033},
year = {2021}
}