中文

贝叶斯多层隐马尔可夫模型的样本量考量:基于睡眠数据且具有高度重叠分量分布的多元连续数据模拟研究

统计方法学 2022-01-25 v1 统计计算

摘要

部分受传感器与基于网络的数据收集方法数量不断增长的推动,密集型纵向数据(ILD)在社会与行为科学中的使用正变得愈发普遍。该领域收集的 ILD 常被假设为潜在状态(如行为、情绪)的结果,而 ILD 的前景在于其能够捕捉这些状态随时间展开的动态。特别地,通过对多个受试者收集数据,研究者可观察此类动态如何因受试者而异。贝叶斯多层隐马尔可夫模型(mHMM)是一种相对新颖的模型,适用于对这类 ILD 建模,同时考虑受试者间的异质性。尽管 mHMM 已应用于多种场景,但考察该模型所需样本量的大规模研究尚属缺乏。本文中,我们通过开展模拟研究来解决这一研究空白,评估(1)受试者数量、(2)观测次数、以及(3)受试者间变异性对 mHMM 所得参数估计的影响。我们将该模拟研究置于睡眠研究背景下,其由呈现显著状态依赖分量分布重叠的多元连续数据构成。此外,我们生成了一组具有更一般数据属性的基线场景。总体而言,受试者数量对模型性能影响最大。然而,观测次数对于充分建模潜在状态转移十分重要。我们讨论了数据特征如何影响参数估计,并为希望将 mHMM 应用于自身数据的研究者提供建议。

关键词

引用

@article{arxiv.2201.09033,
  title  = {Sample Size Considerations for Bayesian Multilevel Hidden Markov Models: A Simulation Study on Multivariate Continuous Data with highly overlapping Component Distributions based on Sleep Data},
  author = {Jasper Ginn and Sebastian Mildiner Moraga and Emmeke Aarts},
  journal= {arXiv preprint arXiv:2201.09033},
  year   = {2022}
}

备注

main text: 35 pages, 9 figures. Submitted to Computational Statistics & Data Analysis