中文

一种利用序列模型预测字符大小写的高效架构

计算与语言 2021-01-21 v1

摘要

干净文本数据的匮乏常作为若干自然语言处理应用中的瓶颈。可用数据往往缺乏正确大小写(大写或小写)信息。这在从社交媒体、消息应用及其他在线平台获取文本时经常出现。本文试图通过还原字符正确大小写(俗称 Truecasing)来解决该问题。这样做可提升 NLP 流水线中后续若干处理任务的准确率。我们提出的架构结合卷积神经网络(CNN)、双向长短期记忆网络(LSTM)和条件随机场(CRF),在字符级别工作且无需任何显式特征工程。在本研究中,我们将方法与先前的统计和基于深度学习的方法进行比较。我们的方法相较当前最优水平 F1 分数提升 0.83。由于 truecasing 作为若干应用中的预处理步骤,F1 分数的每次提升都会带来语言处理任务的显著改进。

关键词

引用

@article{arxiv.2002.00738,
  title  = {An Efficient Architecture for Predicting the Case of Characters using Sequence Models},
  author = {Gopi Ramena and Divija Nagaraju and Sukumar Moharana and Debi Prasanna Mohanty and Naresh Purre},
  journal= {arXiv preprint arXiv:2002.00738},
  year   = {2021}
}

备注

to be published in IEEE ICSC 2020 proceedings