中文

一条微博能说多少?基于微博与Twitter的多语言探究

社会与信息网络 2015-06-16 v2 计算与语言 计算机与社会

摘要

本文提出一项多语言研究,针对单条微博文本:(a) 能表达多少内容,(b) 以字符和字节衡量的写入量多少,(c) 不同语言的不同组织发布的帖子在信息内容量上的多少。聚焦三种不同语言(英语、汉语、日语),本研究分析了主要大使馆和新闻机构在微博和Twitter上的账号。我们首先基于公开可用的《世界人权宣言》和TED演讲的翻译字幕,建立量化数字文本中“能表达多少”的准则。这些平行语料库使我们能够确定在不同语言和字符编码下表示相同内容所需的字符数和比特数。然后我们推导出微博和Twitter上选定账号发布的微博帖子中实际包含的信息量。结果证实,具有更大型字符集的语言(如汉语和日语)比英语每个字符包含更多信息,但微博文本中的实际信息内容因组织类型和帖子语言而异。最后我们讨论了微博文本长度限制对不同语言的设计启示。

关键词

引用

@article{arxiv.1506.00572,
  title  = {How much is said in a microblog? A multilingual inquiry based on Weibo and Twitter},
  author = {Han-Teng Liao and King-wa Fu and Scott A. Hale},
  journal= {arXiv preprint arXiv:1506.00572},
  year   = {2015}
}

备注

9 pages, 4 figures WebSci 2015