NOTAM 数据的识别与处理
计算与语言
2021-06-15 v1
摘要
本文展示了如何处理民航领域的 NOTAM(航行通告)数据。主要研究内容如下:1. 数据预处理:针对 NOTAM 原始数据中存在中英混合、结构较差的问题,对原始数据进行清洗,分别处理中文数据与英文数据,完成分词并去除停用词。使用 Glove 词向量方法表示数据以构建自定义映射词表。2. 特征与分类器解耦:为提升文本分类模型对少数类样本的识别能力,从算法整体角度将整体模型训练过程解耦,分为特征学习与分类器学习两个阶段。特征学习阶段与分类器学习阶段的权重采用不同策略,以克服不平衡数据集中头部数据与尾部数据对分类模型的影响。实验证明,基于神经网络分类模型采用特征与分类器解耦方法,能够完成民航领域文本多分类任务,同时可提升数据集中少数类样本的识别准确率。
引用
@article{arxiv.2105.03314,
title = {Recognition and Processing of NATOM},
author = {YiPeng Deng and YinHui Luo},
journal= {arXiv preprint arXiv:2105.03314},
year = {2021}
}