中文

基于聚合获取函数的主动学习:精度与可持续性分析

机器学习 2026-03-25 v1

摘要

主动学习(AL)是一种机器学习(ML)方法,通过战略性地选择最具信息性的样本进行标注,以最小化标注成本。该策略不仅减少了标注费用,还在神经网络训练期间实现能源节省,从而提升数据和能源效率。本文实现和评估了各种最新获取函数,分析其精度和计算成本,并讨论了各方法的优缺点。我们的发现表明,基于代表性的获取函数有效地探索数据集,但未优先考虑边界决策;而基于不确定性的获取函数专注于细化神经网络已识别的边界决策。这一权衡被称为探索-开发矛盾。为解决这一矛盾,我们引入六种聚合结构:串行、并行、混合、自适应反馈、随机探索和退火探索。我们的聚合获取函数缓解了常见的AL病理现象,如批处理模式低效和冷启动问题。此外,我们关注精度与能耗之间的平衡,为开发更可持续的人工智能(AI)系统贡献了重要工作。我们在各种模型和数据集上对所提结构进行评估。结果表明,这些结构在保持或甚至提升精度的同时,能够降低计算成本。诸如在BALD和BADGE之间交替使用的创新聚合方法表现稳健。顺序运行如K-Centers随后是BALD的函数,虽然只需少量样本(最高可减少12%),但将获取成本降低近一半。

关键词

引用

@article{arxiv.2602.07440,
  title  = {Active Learning Using Aggregated Acquisition Functions: Accuracy and Sustainability Analysis},
  author = {Cédric Jung and Shirin Salehi and Anke Schmeink},
  journal= {arXiv preprint arXiv:2602.07440},
  year   = {2026}
}