中文

将序列到序列模型适配于社交媒体文本规范化

计算与语言 2019-04-15 v1 人工智能 机器学习

摘要

社交媒体提供了大量宝贵的原始数据,然而非正式写作很快就会成为许多自然语言处理(NLP)任务的瓶颈。现成的工具通常在正式文本上训练,无法显式处理短在线帖子中出现的噪声。此外,频繁出现的语言变体多样性带来了若干挑战,即使对于可能无法理解此类帖子含义的人类而言也是如此,尤其是当其中包含俚语和缩写时。文本规范化旨在将在线用户生成文本转换为规范形式。当前的文本规范化系统依赖于字符串或语音相似性以及在局部方式上工作的分类模型。我们认为处理上下文信息对该任务至关重要,并引入了一种基于词-字符注意力机制的社交媒体文本规范化混合编码器-解码器模型,该模型可作为 NLP 应用的预处理步骤,以适配社交媒体中的噪声文本。我们的基于字符的组件在合成对抗样本上训练,这些样本旨在捕捉在线用户生成文本中常见的错误。实验表明,我们的模型超越了为文本规范化设计的神经架构,并达到了与最先进相关工作相当的性能。

关键词

引用

@article{arxiv.1904.06100,
  title  = {Adapting Sequence to Sequence models for Text Normalization in Social Media},
  author = {Ismini Lourentzou and Kabir Manghnani and ChengXiang Zhai},
  journal= {arXiv preprint arXiv:1904.06100},
  year   = {2019}
}

备注

Accepted at the 13th International AAAI Conference on Web and Social Media (ICWSM 2019)