sanba:基于共享原子嵌套模型的分布贝叶斯聚类 R 包
统计计算
2025-08-14 v1
摘要
嵌套数据结构在观察被组织成 distinct 单位的情况下出现,例如患者 within 医院或学生 within 学校。忽略这种层次结构进行推断会导致偏差估计和较差的概括。在本文中,我们解决了同时对单个观察值及其对应组进行聚类,同时灵活估计组特异密度的挑战。贝叶斯嵌套混合模型提供了一种原则且稳健的框架来解决此问题。然而,其实际应用常常受到计算复杂性的限制。为克服这一障碍,我们提出了 sanba,这是一个用于使用具有共享原子集的嵌套混合模型进行分组数据的贝叶斯分析的 R 包。该包提供了多种推断策略,包括为大规模数据集量身定制的最新马尔可夫链蒙特卡洌抽样程序和变分推断算法。所有核心函数均实现于 C++,并无缝集成到 R 中,使 sanba 成为使用现代贝叶斯算法拟合嵌套混合模型的快速且用户友好的工具。
关键词
引用
@article{arxiv.2508.09758,
title = {sanba: An R Package for Bayesian Clustering of Distributions via Shared Atoms Nested Models},
author = {Francesco Denti and Laura D'Angelo},
journal= {arXiv preprint arXiv:2508.09758},
year = {2025}
}