面向半监督大规模数据流的可扩展教师强制网络
分布式、并行与集群计算
2021-07-08 v1 人工智能
机器学习
摘要
大规模数据流问题指的是在传统计算平台下无法以可扩展方式处理的高速信息流。该问题还带来了昂贵的标注成本,使得完全监督算法的部署不可行。另一方面,半监督大规模数据流问题在文献中鲜有探索,因为大多数工作设计在传统单节点计算环境中,且均为完全监督方法。本文提出弱监督可扩展教师强制网络(WeScatterNet)以同时应对标注样本稀缺与大规模数据流问题。WeScatterNet构建于Apache Spark分布式计算平台之下,采用无数据模型融合策略在并行计算阶段后进行模型压缩。它具有开放网络结构以解决全局与局部漂移问题,同时集成数据增强、标注与自动校正()方法以处理部分标注数据流。WeScatterNet的性能在六个仅含标签比例的大规模数据流问题中进行了数值评估。即便与具有标签比例的完全监督学习器相比,它也展现出极具竞争力的性能。
引用
@article{arxiv.2107.02943,
title = {Scalable Teacher Forcing Network for Semi-Supervised Large Scale Data Streams},
author = {Mahardhika Pratama and Choiru Za'in and Edwin Lughofer and Eric Pardede and Dwi A. P. Rahayu},
journal= {arXiv preprint arXiv:2107.02943},
year = {2021}
}
备注
This paper has been accepted for publication in Information Sciences