中文

面向具有结构依赖与异质性的复杂系统数据的多尺度主因子选择

统计方法学 2022-09-07 v1 应用统计

摘要

基于从大型复杂系统导出的结构化数据,我们在计算上进一步开发并精炼了一种主因子选择协议,通过容纳众多特征间的结构依赖与异质性来揭示数据的信息内容。在我们的协议中扮演关键角色的两个操作概念——“去关联(de-associating)”及其对应概念“阴影化(shadowing)”——经由列联表平台被推理、解释并执行。该协议借助“去关联”能力,通过识别哪些协变量特征集在已识别的首批主因子之外提供或不提供信息,从而作为次级成员加入主因子集合,来显现数据的信息内容。我们的计算开发始于通过多个响应(Re)特征与众多协变量(Co)特征间的结构依赖对复杂系统作全局刻画。我们首先将主因子选择协议应用于行为风险因素监测系统(BRFSS)数据集,以展示心脏病患者成为多数群体或进一步缩减的少数群体、与数据不平衡本质形成尖锐对比的局部发现。随后我们研究一个由3个赛季12名投手组成的大联盟棒球(MLB)数据集,揭示关于投球动力学的详细多尺度信息内容,并对多类分类(MCC)问题以及检测任意个体投手跨多个赛季的特异性变化这一困难任务提供近乎完美的分辨。我们最后提出一个直观猜想:与推断主题相关的大型复杂系统,只有通过揭示反映系统真实结构依赖与异质性的数据多尺度信息内容,才能被有效解决。

关键词

引用

@article{arxiv.2209.02623,
  title  = {Multiscale major factor selections for complex system data with structural dependency and heterogeneity},
  author = {Hsieh Fushing and Elizabeth Chou and Ting-Li Chen},
  journal= {arXiv preprint arXiv:2209.02623},
  year   = {2022}
}