基于约束聚类的大规模数据集时空分类方法(标签有限)
机器学习
2022-10-17 v1
摘要
通过表示学习与聚类创建可分离表示,在分析仅含少量标签的大型非结构化数据集中至关重要。可分离表示可带来具有更优分类能力的监督模型,并有助于生成新的标注样本。大多数用于分析大型数据集的无监督与半监督方法并未利用已有的少量标签来获得更好的表示。本文提出一种时空聚类范式,其结合空间与时间特征及约束损失来生成可分离表示。我们在新发布的数据集ReaLSAT上展示了该方法的工作机制,该数据集涵盖全球超过680,000个湖泊的地表水动态,是生态与可持续性方面的重要数据集。利用这一大型无标签数据集,我们首先展示了时空表示优于仅空间或仅时间表示;继而展示如何通过带少量标签的约束损失学习更佳表示;最后展示我们的方法如何利用少量标签从无标签数据中挑选出新的标注样本,从而用于增强监督方法以获得更好的分类效果。
引用
@article{arxiv.2210.07522,
title = {Spatiotemporal Classification with limited labels using Constrained Clustering for large datasets},
author = {Praveen Ravirathinam and Rahul Ghosh and Ke Wang and Keyang Xuan and Ankush Khandelwal and Hilary Dugan and Paul Hanson and Vipin Kumar},
journal= {arXiv preprint arXiv:2210.07522},
year = {2022}
}
备注
9 pages