中文

推特数据的词汇标准化

计算与语言 2015-09-22 v4

摘要

全球拥有超过5000万用户的推特每分钟生成超过10万条推文。140字符的限制或许无意中鼓励用户使用缩写符号并将拼写简化到最基本的“音节”或省略形式,例如“srsly”。包含拼写错误、缩写和语法错误的推特消息的分析,通常会给旨在假设数据符合常用英语语言基本语法结构的现有自然语言处理(NLP)工具带来挑战。在对推特消息进行分析之前,必须将其转换为与字典或语法一致的规范形式。这种在单个标记(“单词”)级别上执行的过程称为词汇标准化。本文研究了用于推特数据词汇标准化的各种技术,并报告了将这些技术应用于处理推特原始数据所获得的 findings。

关键词

引用

@article{arxiv.1409.4614,
  title  = {Lexical Normalisation of Twitter Data},
  author = {Bilal Ahmed},
  journal= {arXiv preprint arXiv:1409.4614},
  year   = {2015}
}

备注

Removed typos