社交媒体短文本消息的语言检测
计算与语言
2016-08-31 v1 人工智能
摘要
随着万维网的持续增长以及不同语言文档数量的相应增加,对可靠语言检测工具的需求也随之上升。像 Twitter 这样以短文本为主的平台正成为重要的信息资源,这进一步催生了对短文本语言检测算法的需求。本文展示了如何将个性化的用户特定信息融入语言检测算法,从而显著提升检测结果。为选择最佳的短文本消息语言检测算法,我们研究了多种机器学习方法。这些方法包括使用著名的分类器(如 SVM 和逻辑回归)、基于词典的方法,以及基于改进 Kneser-Ney 平滑的概率模型。此外,我们还探索了扩展概率模型以纳入额外的用户特定信息,如每用户证据累积和用户界面语言,旨在提高分类性能。所提出的方法在随机收集的包含拉丁字母和非拉丁字母语言的 Twitter 数据上进行评估,并比较了所得结果的质量,随后选出了性能最佳的算法。然后将该算法与两个现有的通用语言检测工具——Chromium Compact Language Detector 2 (CLD2) 和 langid——进行对比评估,我们的方法显著优于上述两种方法所取得的结果。此外,本文还预览了拥有可靠语言检测算法的益处和可能的应用。
引用
@article{arxiv.1608.08515,
title = {Language Detection For Short Text Messages In Social Media},
author = {Ivana Balazevic and Mikio Braun and Klaus-Robert Müller},
journal= {arXiv preprint arXiv:1608.08515},
year = {2016}
}