上下文主动模型选择
机器学习
2025-02-11 v4 人工智能
机器学习
摘要
尽管训练模型与标注数据耗费大量资源,但存在丰富的预训练模型与未标注数据。为有效利用这些资源,我们提出一种在最小化标注成本的同时主动选择预训练模型的方法。我们将此问题构建为在线上下文主动模型选择问题:在每一轮中,学习器接收一个未标注数据点作为上下文。目标是在限制标注请求的同时自适应地选择最佳模型进行预测。为解决该问题,我们提出 CAMS,一种上下文主动模型选择算法,其依赖于两个新颖组件:(1)上下文模型选择机制,利用上下文信息对给定上下文最可能表现最佳的模型做出明智决策;(2)主动查询组件,策略性地选择何时请求数据点的标签,最小化总体标注成本。我们针对对抗与随机两种设定下的后悔值与查询复杂度提供了严格的理论分析。此外,我们在多种基准分类任务上展示了算法的有效性。值得注意的是,在 CIFAR10 与 DRIFT 基准上,CAMS 所需的标注工作量(少于 10%)相较现有方法大幅降低,同时取得了相似或更好的准确率。我们的代码公开于:https://github.com/xuefeng-cs/Contextual-Active-Model-Selection。
引用
@article{arxiv.2207.06030,
title = {Contextual Active Model Selection},
author = {Xuefeng Liu and Fangfang Xia and Rick L. Stevens and Yuxin Chen},
journal= {arXiv preprint arXiv:2207.06030},
year = {2025}
}