基于选择的漏洞:主动学习中的洁标签后门攻击
密码学与安全
2025-08-11 v1 人工智能
摘要
主动学习(AL)作为代表性的标签高效学习范式在资源受限场景中得到广泛应用。其成就归功于用于识别最重要待标注数据的获取函数。尽管如此,一个问题仍未解答:主动学习是否安全?本文引入ALA,一个实用且首次利用获取函数作为投毒攻击面以揭示主动学习弱点的框架。具体而言,ALA优化不可察觉的受投毒输入,使其呈现高不确定性得分,从而增加其被获取函数选中概率。为评估ALA,我们在三个数据集、三个获取函数和两种洁标签后门触发器类型上进行了大规模实验。结果表明,即便在低投毒预算(0.5%-1.0%)下,攻击仍可实现高成功率(最高达94%),同时保持模型实用性且对人类标注员难以察觉。我们的发现提醒主动学习用户:获取函数可能轻易被滥用,主动学习应在可信数据场景下谨慎部署。
引用
@article{arxiv.2508.05681,
title = {Selection-Based Vulnerabilities: Clean-Label Backdoor Attacks in Active Learning},
author = {Yuhan Zhi and Longtian Wang and Xiaofei Xie and Chao Shen and Qiang Hu and Xiaohong Guan},
journal= {arXiv preprint arXiv:2508.05681},
year = {2025}
}