两个数据集的故事:网络样本推断的代表性与可泛化性
统计方法学
2024-01-02 v4 应用统计
摘要
过去二十年间,统计网络分析的基础理论取得了显著进展,但从理论到应用的路径并非直截了当。在比利时,通过两种不同但互补的抽样设计收集了两个大型异质的小规模网络样本,这些网络刻画了家庭内部接触关系:一个样本较小,但观测到每个家庭内的所有接触;另一个样本较大且更具代表性,但仅记录每个家庭中一人的接触。我们希望结合两者的优势,以了解塑造家庭接触形成的社会力量,并为疾病传播预测提供便利的模拟,同时泛化到该地区的家庭总体。为此,我们描述了一个在指数族类中指定多网络模型的灵活框架,并明确了在该框架下推断与预测保持一致、可识别且可泛化(即便数据不完整)的要求;探讨了这些要求在实践中可能被违背的方式;并开发了一套定量与图形诊断方法,用于检测违背情况并提出对候选模型的改进建议。我们报告了网络规模、地理因素与家庭角色对家庭接触模式(活跃度、活跃度异质性以及三元闭包)的影响。
引用
@article{arxiv.2202.03685,
title = {A Tale of Two Datasets: Representativeness and Generalisability of Inference for Samples of Networks},
author = {Pavel N. Krivitsky and Pietro Coletti and Niel Hens},
journal= {arXiv preprint arXiv:2202.03685},
year = {2024}
}
备注
101 pages (3 front matter, 26 body, 72 appendix), 35 figures (4 body, 31 appendix), 66 tables (1 body, 61 appendix)