使用 Portal 深入分析纽约市出租车数据
数据库
2017-09-20 v1
摘要
在本文中,我们开发了一种在不同时间与地理粒度层级上分析交通数据的方法,并将其应用于由 NYC Taxi & Limousine Commission 公开发布的 TLC Trip Record Dataset。该数据自然地表示为一组轨迹,并标注了时间以及乘客数量和费用等附加信息。我们分析 TLC 数据以识别热点(指向缺乏便利的公共交通选项)和热门路线(促使拼车方案或增设公交线路)。我们的方法基于使用一个名为 Portal 的系统,该系统实现了演化图的高效表示与规范化分析方法。Portal 构建于流行的分布式数据处理系统 Apache Spark 之上,可与其他 Spark 库(如 SparkSQL)互操作,并支持对演化图的高效复杂分析。Portal 目前正在 Drexel 的 Data, Responsibly Lab 开发中。我们计划于 2017 年秋季将 Portal 开源发布。
引用
@article{arxiv.1709.06176,
title = {Zooming in on NYC taxi data with Portal},
author = {Julia Stoyanovich and Matthew Gilbride and Vera Zaychik Moffitt},
journal= {arXiv preprint arXiv:1709.06176},
year = {2017}
}
备注
Presented at Data Science for Social Good (DSSG) 2017: https://dssg.uchicago.edu/data-science-for-social-good-conference-2017/