面向高效阿拉伯语浏览的 Web 搜索结果聚类
信息检索
2013-05-14 v1
摘要
浏览搜索结果是传统 Web 搜索引擎(无论是英语、欧洲语言还是其他语言,尤其是阿拉伯语)面临的主要问题之一。这一过程极其耗时,且浏览方式显得缺乏吸引力。将 Web 搜索结果组织成簇有助于用户快速浏览搜索结果。传统的聚类技术(以数据为中心的聚类算法)并不充分,因为它们无法生成具有高度可读名称或簇标签的簇。为解决这一问题,人们引入并成功广泛使用了以描述为中心的算法,如后缀树聚类(STC)算法,并针对不同语言推出了多种适配版本,适用于英语、欧洲语言和中文。然而,截至本文撰写之日,据我们所知,STC 算法从未被应用于阿拉伯语 Web 片段搜索结果的聚类。在本文中,我们首先研究如何将 STC 应用于阿拉伯语?随后通过实例说明,在对阿拉伯语片段进行预处理(词干或词根提取)后应用 STC 是不可行的,因为合并过程会产生大量冗余簇。其次,为克服这一问题,我们提出将 STC 整合到一个新方案中,该方案考虑了阿拉伯语的特性,以使 Web 更好地适应阿拉伯语用户。所提出的方法能够自动将 Web 搜索结果聚类为高质量且具有高显著性的簇标签。所得簇不仅具有连贯性,还能简洁准确地向用户传达内容。因此,阿拉伯语用户可以一目了然地判断某个簇的内容是否感兴趣……
引用
@article{arxiv.1305.2755,
title = {Clustering Web Search Results For Effective Arabic Language Browsing},
author = {Issam Sahmoudi and Abdelmonaime Lachkar},
journal= {arXiv preprint arXiv:1305.2755},
year = {2013}
}