中文

结合对抗训练与预训练语言模型及神经网络的文本分类模型:电信诈骗文本案例研究

人工智能 2024-11-12 v1

摘要

前线警察人员通常将所有警方接报的电信诈骗案件归类为 14 个子类别,以促进有针对性的预防措施,例如精准公众教育。然而,相关数据具有数据量大、信息内容多样和表达差异大等特点。目前缺乏高效且准确的智能模型来替代人工分类,后者虽然精确但效率相对较低。为应对这些挑战,本文提出了一种结合对抗训练与预训练语言模型及神经网络的文本分类模型。语言学驱动的预训练语言模型提取三种语言特征,然后利用快速梯度法算法扰动生成的嵌入层。随后,双向长短期记忆网络和卷积神经网络分别提取上下文句法信息和局部语义信息。该模型在使用运营部门提供的部分电信诈骗案件数据训练时达到了 83.9% 的分类准确率。本文所建立的模型已在运营部门部署,释放了大量人力并提高了该部门打击电信诈骗犯罪的效率。此外,考虑到本文所建立模型的通用性,其他应用场景有待进一步探索。

关键词

引用

@article{arxiv.2411.06772,
  title  = {A Text Classification Model Combining Adversarial Training with Pre-trained Language Model and neural networks: A Case Study on Telecom Fraud Incident Texts},
  author = {Liu Zhuoxian and Shi Tuo and Hu Xiaofeng},
  journal= {arXiv preprint arXiv:2411.06772},
  year   = {2024}
}