中文

身份误认导致机遇错失:部分匹配数据中的均值差异检验

最优化与控制 2025-04-08 v3 系统与控制 系统与控制

摘要

收集带有假名或自构建标识符的前后测数据日益普遍。在来自敏感人群的调查回复中,标识符可能被设为可选以提高回复率。在此类应用中,可能无法为每位参与者匹配干预前后阶段的回复,使得从业者在评估均值差异时,不得不在对匹配样本使用配对 t 检验与对所有样本使用双样本 t 检验之间做出选择。我们展示了这两种方法的不足之处,因为前者检验需要丢弃未匹配的数据,而后者检验忽略了相关性并假设独立性。在存在部分匹配样本的情况下,存在对相关性进行有限推断的机会。我们针对此类“部分匹配”数据提出了一种新技术,称为基于分位数的相关样本 t 检验(Quantile-based t-test for correlated samples),该方法利用基于匹配子集的相关性保守估计来评估均值差异。关键在于,我们的方法既不丢弃未匹配样本,也不假设独立性。我们的结果表明,所提出的方法产生了标称的第一类错误概率,同时比现有方法具有更高的功效。从业者可以轻松采用基本统计编程软件来应用我们的方法。

关键词

引用

@article{arxiv.2312.14690,
  title  = {Distributed Stochastic Bilevel Optimization: Improved Complexity and Heterogeneity Analysis},
  author = {Youcheng Niu and Jinming Xu and Ying Sun and Yan Huang and Li Chai},
  journal= {arXiv preprint arXiv:2312.14690},
  year   = {2025}
}

备注

Accepted by JMLR