在偏好抽样条件下多类别均值比率的非参数识别与估计
统计方法学
2025-10-29 v1
摘要
多类别数据出现在广泛的领域,包括营销、化学、公共政策、基因组学、政治学和生态学等。我们考虑在完全非参数设置下估计类别特定均值的比率,允许观测单元和类别被偏好抽样。我们考虑基于协变量调整和未调整的估计量,这些估计量是非参数定义且易于解释的。虽然与相关模型的可识别性通过参数分布或条件均值限制(例如对数线性)已被建立,但我们展示可以通过独立性假设或类别约束(如参考类别或中心化函数)获得可识别性。我们开发了一种高效、双鲁棒的针对最小损失的估计器,在有限样本性能方面表现优异,包括在大量不频繁观察到的类别的情形下。我们通过仿真对该方法与相关方法的表现进行对比,并将其应用于识别与对照组相比,肠易激综合征患者中差异丰度的细菌。我们的工作提供了一个在不要求数据分布具有参数假设的情况下研究参数可识别性的通用框架。
引用
@article{arxiv.2510.23920,
title = {Nonparametric Identification and Estimation of Ratios of Multi-Category Means under Preferential Sampling},
author = {Grant Hopkins and Sarah Teichman and Ellen Graham and Amy D Willis},
journal= {arXiv preprint arXiv:2510.23920},
year = {2025}
}