中文

浏览器内自包含搜索引擎的可行性与影响

信息检索 2014-10-17 v1

摘要

现代浏览器内的 JavaScript 引擎能够运行复杂的多玩家游戏、渲染令人印象深刻的 3D 场景并支持复杂的交互式可视化。这种处理能力能否被用于信息检索?本文探讨了构建一个完全在浏览器客户端自包含运行的 JavaScript 搜索引擎的可行性——这包括构建倒排索引、收集用于评分的术语统计信息以及执行查询评估。该设计利用了 IndexDB API,该 API 在 Google Chrome 浏览器内部由 LevelDB 键值存储实现。实验表明,尽管该 JavaScript 原型的性能远不及开源的 Lucene 搜索引擎,但其响应速度足以满足交互式应用的需求。这一可行性演示为跨平台的离线和隐私搜索以及客户端与服务器协同执行查询评估的混合分割执行架构等有趣应用打开了大门。一种可能的未来情景是出现一个在线搜索市场,其中商业搜索引擎公司和个体用户作为理性经济参与者,基于可定制的效用配置文件来平衡隐私、资源使用、延迟和其他因素。

关键词

引用

@article{arxiv.1410.4500,
  title  = {On the Feasibility and Implications of Self-Contained Search Engines in the Browser},
  author = {Jimmy Lin},
  journal= {arXiv preprint arXiv:1410.4500},
  year   = {2014}
}