众多名单与异质性背景下的人口规模估计:基于未观察群体中条件对数线性模型
统计方法学
2024-07-08 v1 应用统计
摘要
我们贡献了一个通用且灵活的框架,用于估计在存在 个捕获-再捕获名单且捕获概率呈异质性的封闭人群的规模。我们 novel 的识别策略利用了这样一个事实:只要 个名单中的一个子集在剩余名单未观察到的该子集人群中没有任意依赖,就足够进行识别。这种识别方法是可解释且可操作的,介于文献中两种主要方法的特殊案例之间:(条件)独立性跨名单和无最高阶相互作用的对数线性模型。我们推导了用于估计所得识别表达式的非参数 doubly-robust 估计器,即使异质捕获概率通过机器学习方法进行非参数估计,这些估计器也接近最优且在任意有限样本量下近正态。此外,我们设计了一个敏感性分析,以显示识别假设的偏离如何影响所得的人口规模估计,允许将领域特定知识更透明地整合到识别和估计过程中。我们使用合成数据和来自秘鲁内战的真实数据来估计死亡人数,展示了我们方法的优势。该方法论是对捕获-再捕获模型的最新批评的回应,允许更具可解释性且较弱的识别假设,并容纳取决于高维或连续协变的复杂异质捕获概率。
引用
@article{arxiv.2407.03539,
title = {Population Size Estimation with Many Lists and Heterogeneity: A Conditional Log-Linear Model Among the Unobserved},
author = {Mateo Dulce Rubio and Edward Kennedy},
journal= {arXiv preprint arXiv:2407.03539},
year = {2024}
}