中文

温度缩放攻击扰乱联邦学习中的模型置信度

机器学习 2026-02-10 v2 人工智能 新兴技术

摘要

预测置信度是使命关键系统的基础控制信号,直接支配风险感知逻辑,如升级、放弃和保守后备。虽然先前的联邦学习攻击主要针对准确率或植入后门,但我们识别了置信度校准作为一种独特的攻击目标。我们提出了温度缩放攻击(TSA),这是一种训练时的攻击,通过在本地训练期间注入带有学习率-温度耦合的温度缩放,恶意更新维持类似良好优化行为,规避基于准确率的监控和基于相似性的检测。我们在非IID设置下提供了收敛分析,表明该耦合保持标准收敛界限,同时系统性地扭曲置信度。在三个基准测试中,TSA显著偏移校准(例如,CIFAR-100上错误增加145%),而准确率变化小于2%,在稳健聚合和事后校准防御下仍有效。案例研究进一步表明,置信度操纵可导致临床(医疗保健)或误报(自动驾驶)的关键案例漏检增加最高达7.2倍,即使准确率未变。总体而言,我们的结果确立了联邦学习中的校准完整性作为关键攻击面。

关键词

引用

@article{arxiv.2602.06638,
  title  = {Temperature Scaling Attack Disrupting Model Confidence in Federated Learning},
  author = {Kichang Lee and Jaeho Jin and JaeYeon Park and Songkuk Kim and JeongGil Ko},
  journal= {arXiv preprint arXiv:2602.06638},
  year   = {2026}
}

备注

20 pages, 20 figures