初步 F 检验后回归中置信区间的覆盖概率
统计理论
2017-10-18 v1 统计理论
摘要
考虑一个具有回归参数 beta=(beta_1,..., beta_p) 和独立正态误差的线性回归模型。假设感兴趣的参数是 theta = a^T beta,其中 a 是给定的。定义 s 维参数向量 tau = C^T beta - t,其中 C 和 t 是给定的。假设我们对原假设 H_0: tau = 0 进行初步 F 检验,备择假设为 H_1: tau 不等于 0。常见的统计实践是,然后基于所选模型是先验给定的(作为真实模型)这一假设,使用相同数据构建名义覆盖概率为 1-alpha 的 theta 置信区间。我们称其为 theta 的朴素 1-alpha 置信区间。这一假设是错误的,可能导致该置信区间的最小覆盖概率远低于 1-alpha,使其完全不可用。我们的目标是计算这个最小覆盖概率。直接找到该置信区间覆盖概率的表达式是一个 s+1 维的多重积分。然而,我们推导了一个新的、优雅且计算方便的覆盖概率公式。对于 s=2,该公式是一个三重积分和一个二重积分之和;对于所有 s>2,该公式是一个四重积分和一个二重积分之和。这使得无论 s 多大,都可以轻松计算朴素置信区间的最小覆盖概率。该公式的一个非常重要的实际应用是协方差分析。在此背景下,tau 的定义使得 H_0 表达了“平行性”假设。应用统计学家通常建议对该假设进行初步 F 检验。我们用一个真实的协方差分析数据集和针对“平行性”的初步 F 检验来说明我们公式的应用。我们表明,朴素 0.95 置信区间的最小覆盖概率为 0.0846,表明它完全不可用。
引用
@article{arxiv.1003.2439,
title = {The coverage probabililty of confidence intervals in regression after a preliminary F test},
author = {Paul Kabaila and Davide Farchione},
journal= {arXiv preprint arXiv:1003.2439},
year = {2017}
}