FLAIR:联邦学习标注图像库
机器学习
2022-07-20 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
跨设备联邦学习是一种新兴的机器学习(ML)范式,其中大量设备集体训练一个 ML 模型,而数据保留在设备上。这一研究领域具有一系列独特的实际挑战,为了系统性地取得进展,需要策划与这一范式兼容的新数据集。图像领域现有的联邦学习基准未能准确捕捉许多现实世界用例的规模和异质性。我们引入 FLAIR,一个适用于联邦学习的具有挑战性的大规模标注图像数据集,用于多标签分类。FLAIR 包含来自 51,414 名 Flickr 用户的 429,078 张图像,并捕捉了联邦学习中通常遇到的许多复杂性,例如异构用户数据和长尾标签分布。我们针对该数据集上不同任务在不同学习设置下实现了多个基线。我们相信 FLAIR 可以作为一个具有挑战性的基准,推动联邦学习的最先进水平。数据集访问和基准代码可在 \url{https://github.com/apple/ml-flair} 获取。
引用
@article{arxiv.2207.08869,
title = {FLAIR: Federated Learning Annotated Image Repository},
author = {Congzheng Song and Filip Granqvist and Kunal Talwar},
journal= {arXiv preprint arXiv:2207.08869},
year = {2022}
}