基于多变量伯努利分布的多标签数据抽样方法及其在元科研中的应用
机器学习
2026-05-27 v4 机器学习
摘要
数据集中的观测可能包含多个标签。当标签不互斥且标签频率差异巨大时,获取既包含稀有标签充分观测又在已知方式上偏离总体频率的样本,便是一大挑战。本文考虑多变量伯努利分布作为多标签问题的底层分布。我们提出一种新型抽样算法,考虑标签间的依赖性。该方法利用观察到的标签频率估计多变量伯努利分布参数,并计算每个标签组合的权重。这种方法确保加权抽样在考虑标签依赖性的同时获取目标分布特征。我们将其应用于多种数据集,包括来自Web of Science的研究文章样本,涉及64个医学主题类别。我们的目标是保持类别频率顺序、缩小最常见与最少见类别之间的频率差异,并考虑类别间的依赖性。该方法产生更平衡的子样本,显著提升了少数类别的表征。
引用
@article{arxiv.2512.08371,
title = {A Multivariate Bernoulli-Based Sampling Method for Multi-Label Data with Application to Meta-Research},
author = {Simon Chung and Colby J. Vorland and Donna L. Maney and Andrew W. Brown},
journal= {arXiv preprint arXiv:2512.08371},
year = {2026}
}