非独立同分布数据是否会威胁联邦在线排序学习?
信息检索
2022-05-03 v2
摘要
在本观点论文中,我们研究了非独立同分布(non-IID)数据对联邦在线排序学习(FOLTR)的影响,并为信息检索这一新兴且很大程度上未被探索的研究领域的未来工作指明方向。在FOLTR过程中,客户端参与联邦,利用各客户端产生的隐式点击信号共同创建一个有效的排序器,而无需共享数据(文档、查询、点击)。影响联邦学习系统性能且给这些方法带来严峻挑战的一个众所周知的因素是,数据在客户端之间的分布可能存在某种偏差。尽管FOLTR系统本身也是一种联邦学习系统,但FOLTR中非IID数据的存在与影响尚未被研究。为此,我们首先列举了可能展现客户端间数据偏差从而导致非IID问题的数据分布设置。然后,我们研究了每种设置对当前最先进的FOLTR方法——联邦成对可微梯度下降(FPDGD)性能的影响,并指出了哪些数据分布可能对FOLTR方法构成问题。我们还探讨了联邦学习文献中提出的常见方法如何应对FOLTR中的非IID问题。这使我们揭示了未来FOLTR研究应考虑的新研究空白。这是对当前FOLTR领域的重要贡献,因为要使FOLTR系统得以部署,必须透彻理解影响其性能的因素,包括非IID数据的影响。
引用
@article{arxiv.2204.09272,
title = {Is Non-IID Data a Threat in Federated Online Learning to Rank?},
author = {Shuyi Wang and Guido Zuccon},
journal= {arXiv preprint arXiv:2204.09272},
year = {2022}
}
备注
10 pages full paper, accepted at SIGIR2022