中文

饮自消防水管:基于Web规模自然语言的持续学习

机器学习 2020-11-03 v2 计算与语言 机器学习

摘要

持续学习系统将随时间与人类、彼此以及物理世界交互,并在交互过程中持续学习与适应。持续学习的一个重要开放问题是能够进行 realistic 算法评估的大规模基准。本文中,我们研究了一种大规模下的自然持续学习设定。我们引入个性化在线语言学习(POLL)问题,其涉及对随时间演化的一群用户拟合个性化语言模型。为促进POLL研究,我们收集了大规模的Twitter帖子数据集。这些数据集Firehose10M和Firehose100M包含1亿条推文,由一百万用户在六年间发布。借助Firehose数据集,我们展示了前所未有的规模上对持续学习算法的严格评估。基于该分析,我们开发了用于持续梯度下降(ConGraD)的简单算法,其在Firehose数据集以及更早的基准上均优于先前的持续学习方法。总体而言,POLL问题设定、Firehose数据集和ConGraD算法共同实现了用于可复现的Web规模持续学习研究的完整基准。

关键词

引用

@article{arxiv.2007.09335,
  title  = {Drinking from a Firehose: Continual Learning with Web-scale Natural Language},
  author = {Hexiang Hu and Ozan Sener and Fei Sha and Vladlen Koltun},
  journal= {arXiv preprint arXiv:2007.09335},
  year   = {2020}
}

备注

Dataset Downloader: https://github.com/firehose-dataset/downloader Source Code: https://github.com/firehose-dataset/congrad