社交媒体自然语言处理的点彩派方法
信息检索
2012-06-22 v1 计算与语言
社会与信息网络
摘要
中文语言即使在正式使用中也对基于词单元的自然语言处理构成挑战,而社交媒体只会使中文分词更加困难。本文提出一种点彩派的自然语言处理方法。点彩派方法的基本单元不是具有独立意义的词,而是字符三元组。这些三元组在随时间相关的方式共同出现时,在聚合中产生意义。我们从三类实验中得到的结果表明,当词和主题具有类似模因的趋势时,它们可以仅从三元组中重建。例如,对于在我们的数据中一天内至少出现99次的四字成语,无约束精确率(即当结果与词典版本同样正确时允许偏离词典的精确率)为0.93。对于从维基词典收集的较长词和短语(包括新词),无约束精确率为0.87。我们认为这些结果非常有前景,因为它们表明机器可以在没有任何词概念的情况下,以良好的精确率重建复杂的成语、短语和新词。因此,在诸如中文等具有挑战性的语言中,社交媒体典型的丰富多彩且巴洛克式的语言使用实际上可能是机器可访问的。
引用
@article{arxiv.1206.4958,
title = {A Pointillism Approach for Natural Language Processing of Social Media},
author = {Peiyou Song and Anhei Shu and Anyu Zhou and Dan Wallach and Jedidiah R. Crandall},
journal= {arXiv preprint arXiv:1206.4958},
year = {2012}
}
备注
8 pages, 5 figures