中文

粗化潜类别概率:方向性失真与覆盖率损失

计量经济学 2026-08-12 v1 统计方法学 机器学习

摘要

结果变量越来越多地被回归到用于未观测类别归属的校准概率向量上,而该向量通常先被粗化为硬标签。在常系数结构均值和条件校准下,观测数据问题是对结果变量关于概率向量的部分线性回归;我们将此简化作为出发点,探讨粗化的代价。对于任何粗化,插入式估计量收敛于 Aτ\mathcal{A}\tau,其中粗化算子满足 A=I+D1E[ahu]\mathcal{A}=I+D^{-1}\mathbb{E}[a_{h}u^{\top}]uu 为被丢弃的信号。因此,当被丢弃部分与保留部分不相关时粗化是无代价的,否则是各向异性的:它对某些对比的扭曲远大于其他。同一算子也控制推断。由粗化标签构建的 Wald 区间的极限覆盖率为 Φ(zλ)Φ(zλ)\Phi(z-\lambda)-\Phi(-z-\lambda),其中 λ\lambda 为粗化偏差与报告标准误之比;由于 A\mathcal{A} 和该标准误仅依赖于可观测变量,因此在区间报告之前即可近似估计由估计指数所隐含的覆盖率。模拟显示 argmax 粗化后存在严重的覆盖率损失,三项真实数据审计展示了硬标签引起的方向特定失真。

关键词

引用

@article{arxiv.2608.11784,
  title  = {Coarsening Latent-Class Probabilities: Directional Distortion and Coverage Loss},
  author = {Marcell T. Kurbucz},
  journal= {arXiv preprint arXiv:2608.11784},
  year   = {2026}
}

备注

43 pages, 6 figures, 11 tables. Includes supplementary material with all proofs, two further identification results, additional experiments, and a land-cover audit