中文

从类别-实数有序对中推断类别数据顺序的非参数框架

统计方法学 2020-11-10 v1 计算机与社会 统计理论 数据分析、统计与概率 机器学习 统计理论

摘要

给定一个职业与收入的数据集,任意一对职业之间的收入差距会有多大?给定一个出行时间记录的数据集,选择公共交通方式 A 而非 B 出行时我们需要多花多长时间?在本文中,我们提出了一个框架,能够利用估计统计框架推断类别的顺序以及每对类别之间实数差异的大小。我们的框架不仅报告类别顺序是否存在,还报告顺序中每对相邻类别的差异大小。在大型数据集中,与现有框架相比我们的框架具有良好的可扩展性。所提出的框架已应用于两个真实案例研究:1) 基于泰国孔敬府 350,000 户家庭的信息按收入对职业排序;2) 基于 2000 年至 2016 年间纳斯达克股票市场 1060 家公司的收盘价按收盘价对行业排序。职业排序的结果显示了不同职业间的收入不平等。股票市场的结果说明了行业主导地位的动态变化,其可随时间改变。我们的方法可应用于任何具有类别-实数有序对的研究领域。我们提出的“主导-分布网络”提供了一种获得分析类别顺序新见解的新方法。该框架的软件可供研究人员或从业者在 R 包 EDOIF 中使用。

关键词

引用

@article{arxiv.1911.06723,
  title  = {A nonparametric framework for inferring orders of categorical data from category-real ordered pairs},
  author = {Chainarong Amornbunchornvej and Navaporn Surasvadi and Anon Plangprasopchok and Suttipong Thajchayapong},
  journal= {arXiv preprint arXiv:1911.06723},
  year   = {2020}
}

备注

The R package can be found at https://github.com/DarkEyes/EDOIF