基于BERT与新型损失函数的应急领域中文文本分类
计算与语言
2021-04-12 v1 人工智能
摘要
本文提出一种自动中文文本分类方法,用于解决应急事件报告分类问题。由于基于Transformer的双向编码器表示(BERT)在自然语言处理领域已取得巨大成功,本研究采用其来提取应急文本特征。为克服应急事件类别分布中的数据不平衡问题,提出一种新型损失函数以提升基于BERT模型的性能。同时,为避免极端学习率的影响,采用Adabound优化算法(实现从Adam到SGD的渐进平滑过渡)来学习模型参数。为验证所提方法的可行性与有效性,使用了从互联网收集的中文应急文本数据集。与基准方法相比,所提方法在准确率、加权精确率、加权召回率和加权F1值方面均取得了最佳性能。因此,将该方法用于智慧应急管理系统中的实际应用具有良好前景。
引用
@article{arxiv.2104.04197,
title = {BERT-based Chinese Text Classification for Emergency Domain with a Novel Loss Function},
author = {Zhongju Wang and Long Wang and Chao Huang and Xiong Luo},
journal= {arXiv preprint arXiv:2104.04197},
year = {2021}
}
备注
16 pages, 6 figures