中文

CHASe:面向联邦主动学习的客户端异构性感知数据选择

机器学习 2025-04-25 v1 数据库 分布式、并行与集群计算

摘要

主动学习(Active Learning, AL)通过战略性地选择最具信息性的未标记数据进行标注,以降低机器学习系统的人工标注成本,但单独执行仍可能不足,因为数据多样性和标注预算有限。联邦主动学习(Federated Active Learning, FAL)通过促进协作数据选择和模型训练来解决此问题,同时保持原始数据样本的保密性。然而,现有FAL方法未能考虑跨客户端数据分布的异构性以及全局和局部模型参数的伴随波动,这会严重影响模型准确率。为克服这些挑战,我们提出CHASe(Client Heterogeneity-Aware Data Selection),专为FAL设计。CHASe聚焦于识别那些具有高认识变异(epistemic variations, EVs)的未标记样本,这些样本在训练期间会围绕决策边界振荡。为实现有效性和效率,\model{}包括以下技术:1)通过分析训练各时期的推断不一致性来跟踪EVs,2)通过一种新的对齐损失来校准不准确模型的决策边界,3)通过数据冻结和唤醒机制结合子集抽样来提高数据选择效率。实验表明,CHASe在有效性和效率方面均优于各种既定基线,在多样化的数据集、模型复杂度和异构性联邦设置下均得到验证。

关键词

引用

@article{arxiv.2504.17448,
  title  = {CHASe: Client Heterogeneity-Aware Data Selection for Effective Federated Active Learning},
  author = {Jun Zhang and Jue Wang and Huan Li and Zhongle Xie and Ke Chen and Lidan Shou},
  journal= {arXiv preprint arXiv:2504.17448},
  year   = {2025}
}

备注

Accepted by TKDE 2025