Crowdbreaks:利用公共社交媒体数据与众包追踪健康趋势
计算机与社会
2018-05-16 v1 计算与语言
社会与信息网络
机器学习
摘要
在过去十年中,利用社交媒体数据追踪健康趋势展现出巨大前景,这得益于全球社交媒体的大规模普及,以及日益强大的硬件和软件使我们能够处理这些新的大数据流。与此同时,许多挑战性问题已被指出。首先,在线数据变化的速度与算法更新的速度之间常存在错配,这意味着基于过去数据训练的算法可重用性有限,因为其性能会随时间下降。其次,许多工作聚焦于特定过去时期的特定问题,尽管公共卫生机构需要灵活工具来实时评估多种不断演变的情况。第三,大多数提供此类能力的工具是专有系统,算法或数据透明度低,因此难以获得全球公共卫生与研究社区的认可。在此,我们介绍Crowdbreaks,一个开放平台,通过持续众包标注公共社交媒体内容来追踪健康趋势。该系统以自动化典型工作流(从数据收集、过滤、标注到机器学习分类器训练)的方式构建,因此可大幅加速公共卫生领域的研究进程。本工作介绍了该平台的技术方面并探讨其未来用例。
引用
@article{arxiv.1805.05491,
title = {Crowdbreaks: Tracking Health Trends using Public Social Media Data and Crowdsourcing},
author = {Martin Mueller and Marcel Salathé},
journal= {arXiv preprint arXiv:1805.05491},
year = {2018}
}