RD-DPP:率失真理论结合行列式点过程以实现学习数据样本多样化
机器学习
2023-08-17 v2
摘要
在一些实际学习任务中,如交通视频分析,可用训练样本的数量受到不同因素的限制,例如有限的通信带宽与计算能力。行列式点过程(DPP)是一种用于选择最具多样性样本以提升学习质量的常用方法。然而,所选样本的数量受限于由数据样本维度隐含的核矩阵秩。其次,它不易针对不同学习任务进行定制。本文提出一种基于率失真(RD)理论的面向任务多样性度量新方式,适用于多级分类。为此,我们建立了 DPP 与 RD 理论之间的基本关系。我们观察到,DPP 所选数据多样性的上界具有 的普遍趋势,这表明 DPP 仅在样本积累初期有益。这促成了一种双模方法的设计:第一模中使用 RD-DPP 选择初始数据样本,随后第二模中使用分类不一致性(作为一种不确定性度量)选择后续样本。该相变解决了相似矩阵秩的限制。将我们的方法应用于六个不同数据集与五个基准模型表明,在所有采样预算下,我们的方法始终优于随机选择、基于 DPP 的方法以及如基于不确定性与核心集等替代方法,同时对不同学习任务表现出高泛化性。
引用
@article{arxiv.2304.04137,
title = {RD-DPP: Rate-Distortion Theory Meets Determinantal Point Process to Diversify Learning Data Samples},
author = {Xiwen Chen and Huayu Li and Rahul Amin and Abolfazl Razi},
journal= {arXiv preprint arXiv:2304.04137},
year = {2023}
}