面向高效主动学习与稀有概念搜索的相似性搜索
机器学习
2021-07-23 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
许多主动学习与搜索方法在拥有数十亿未标注样本的工业大规模场景下难以扩展。现有方法全局搜索最优标注样本,其复杂度随未标注数据线性甚至二次增长。本文中,我们通过将待标注候选池限制为当前已标注集的最近邻,而非扫描所有未标注数据,从而提升主动学习与搜索方法的计算效率。我们在三个大规模计算机视觉数据集上评估此设定下的若干选择策略:ImageNet、OpenImages,以及一家大型互联网公司提供的 100 亿图像的去标识聚合数据集。我们的方法取得了与传统全局方法相近的平均精度均值与召回率,同时将选择的计算成本降低多达三个数量级,从而实现了 Web 规模的主动学习。
引用
@article{arxiv.2007.00077,
title = {Similarity Search for Efficient Active Learning and Search of Rare Concepts},
author = {Cody Coleman and Edward Chou and Julian Katz-Samuels and Sean Culatana and Peter Bailis and Alexander C. Berg and Robert Nowak and Roshan Sumbaly and Matei Zaharia and I. Zeki Yalniz},
journal= {arXiv preprint arXiv:2007.00077},
year = {2021}
}