从去中心化非IID无标签数据学习是否受益于自监督?
机器学习
2023-03-01 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
去中心化学习已被倡导并广泛部署以高效利用分布式数据集,其大量关注点集中于监督学习(SL)问题。不幸的是,现实世界中的大多数数据是无标签的,并且跨数据源可能高度异构。在本工作中,我们通过自监督学习(SSL)的视角,具体为对比视觉表示学习,仔细研究带有无标签数据的去中心化学习。我们研究了在去中心化学习设置下一系列对比学习算法的有效性,所用相对大规模数据集包括ImageNet-100、MS-COCO以及一个新真实世界机器人仓库数据集。我们的实验表明,去中心化SSL(Dec-SSL)方法对去中心化数据集的异构性具有鲁棒性,并学习到对对象分类、检测与分割任务有用的表示。这种鲁棒性使得仅在性能极小下降的情况下显著减少通信并降低数据源的参与比例成为可能。有趣的是,使用相同数量的数据,Dec-SSL学到的表示不仅能与需要通信与过度数据存储成本的集中式SSL学到的表示表现相当,而且有时优于从需要数据标签额外知识的去中心化SL提取的表示。最后,我们提供理论见解以理解为何数据异构性对Dec-SSL目标而言较少成为问题,并引入特征对齐与聚类技术来开发一种新的Dec-SSL算法,在高度非IID数据面前进一步提升性能。我们的研究提供了在去中心化学习中接纳无标签数据的正面证据,并希望就去中心化SSL是否及为何有效提供新见解。
引用
@article{arxiv.2210.10947,
title = {Does Learning from Decentralized Non-IID Unlabeled Data Benefit from Self Supervision?},
author = {Lirui Wang and Kaiqing Zhang and Yunzhu Li and Yonglong Tian and Russ Tedrake},
journal= {arXiv preprint arXiv:2210.10947},
year = {2023}
}