中文

分布外数据场景下面向主动学习的帕累托优化

机器学习 2022-07-05 v1

摘要

基于池的主动学习(AL)通过从大型无标签数据池中顺序选择信息量丰富的未标注样本并向标注者查询其标签,在最小化标注成本方面取得了巨大成功。然而,现有 AL 采样策略在分布外(OOD)数据场景中可能表现不佳,即无标签数据池中包含不属于目标任务类别的数据样本。由于在 AL 采样策略与 OOD 样本检测之间存在天然冲突,在 OOD 数据场景下取得良好 AL 性能是一项挑战。AL 选择当前基分类器难以分类的数据(例如预测类别概率熵高的样本),而 OOD 样本往往比分布内(ID)数据具有更均匀的预测类别概率(即高熵)。本文提出一种采样方案——主动学习的蒙特卡洛帕累托优化(POAL),从无标签数据池中选择固定批量大小的最优未标注样本子集。我们将 AL 采样任务视为多目标优化问题,从而基于两个冲突目标利用帕累托优化:(1)常规 AL 数据采样方案(如最大熵),以及(2)非 OOD 样本的置信度。实验结果表明其在经典机器学习(ML)与深度学习(DL)任务上的有效性。

关键词

引用

@article{arxiv.2207.01190,
  title  = {Pareto Optimization for Active Learning under Out-of-Distribution Data Scenarios},
  author = {Xueying Zhan and Zeyu Dai and Qingzhong Wang and Qing Li and Haoyi Xiong and Dejing Dou and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2207.01190},
  year   = {2022}
}