中文

RD-DPP:率失真理论结合行列式点过程以实现学习数据样本多样化

机器学习 2023-08-17 v2

摘要

在一些实际学习任务中,如交通视频分析,可用训练样本的数量受到不同因素的限制,例如有限的通信带宽与计算能力。行列式点过程(DPP)是一种用于选择最具多样性样本以提升学习质量的常用方法。然而,所选样本的数量受限于由数据样本维度隐含的核矩阵秩。其次,它不易针对不同学习任务进行定制。本文提出一种基于率失真(RD)理论的面向任务多样性度量新方式,适用于多级分类。为此,我们建立了 DPP 与 RD 理论之间的基本关系。我们观察到,DPP 所选数据多样性的上界具有 相变\textit{相变} 的普遍趋势,这表明 DPP 仅在样本积累初期有益。这促成了一种双模方法的设计:第一模中使用 RD-DPP 选择初始数据样本,随后第二模中使用分类不一致性(作为一种不确定性度量)选择后续样本。该相变解决了相似矩阵秩的限制。将我们的方法应用于六个不同数据集与五个基准模型表明,在所有采样预算下,我们的方法始终优于随机选择、基于 DPP 的方法以及如基于不确定性与核心集等替代方法,同时对不同学习任务表现出高泛化性。

关键词

引用

@article{arxiv.2304.04137,
  title  = {RD-DPP: Rate-Distortion Theory Meets Determinantal Point Process to Diversify Learning Data Samples},
  author = {Xiwen Chen and Huayu Li and Rahul Amin and Abolfazl Razi},
  journal= {arXiv preprint arXiv:2304.04137},
  year   = {2023}
}