大数据时代的快速数据:Twitter 实时相关查询建议架构
信息检索
2012-10-30 v1 数据库
摘要
我们介绍了 Twitter 实时相关查询建议和拼写校正服务背后的架构。尽管这些任务在网络搜索文献中已受到广泛关注,但 Twitter 语境引入了一个实时“转折”:在重大突发新闻事件发生后,我们的目标是在几分钟内提供相关结果。本文提供了一个案例研究,阐述了“大数据”时代实时数据处理的挑战。我们讲述了系统两次构建的故事:我们的第一个实现建立在典型的基于 Hadoop 的分析栈之上,但因无法满足生成有意义的实时结果所需的延迟要求而被替换。第二个实现即部署在生产环境中的系统,是一个专为该任务设计的自定义内存处理引擎。这段经历使我们认识到,当前将 Hadoop 作为“大数据”平台的典型用法虽然非常适合实验,但并不适用于低延迟处理,并指出了未来数据处理平台研究方向,即能够同时处理“大”数据和“快”数据的平台。
引用
@article{arxiv.1210.7350,
title = {Fast Data in the Era of Big Data: Twitter's Real-Time Related Query Suggestion Architecture},
author = {Gilad Mishne and Jeff Dalton and Zhenghua Li and Aneesh Sharma and Jimmy Lin},
journal= {arXiv preprint arXiv:1210.7350},
year = {2012}
}