关于具有预定主体划分及部分控制变量边缘相关结构的合成区间数据
统计方法学
2025-07-08 v3 统计计算
摘要
评估划分模型性能的标准方法是创建具有预设聚类结构的合成数据集,并评估模型揭示该结构的程度。一种常见格式是将主体分配到不同的聚类中,并模拟观测值,使得同一聚类内的主体具有相似的剖面,同时允许一定的变异性。在本文中,我们考虑来自取有限个值的区间变量的观测值。区间数据常在队列研究和全基因组关联研究 (Genome Wide Association studies) 中观察到,我们的重点是单核苷酸多态性 (Single Nucleotide Polymorphisms)。利用理论和实证结果探索了变量间的依赖结构及其与主体聚类结构的关系。提出了一种新算法,允许控制变量的边缘分层相关结构,指定变量组内的精确相关值。展示了实际示例,并将合成数据集与真实数据集进行了比较,以论证其异同。
引用
@article{arxiv.1709.00872,
title = {On synthetic interval data with predetermined subject partitioning, and partial control of the variables' marginal correlation structure},
author = {Michail Papathomas},
journal= {arXiv preprint arXiv:1709.00872},
year = {2025}
}
备注
25 pages