Reptile:面向层次化数据的聚合级解释系统
数据库
2021-03-15 v1
摘要
近期的查询解释系统通过提出谓词来描述输入记录(若删除这些记录将解决异常)来帮助用户理解聚合结果中的异常。然而,用户难以理解谓词是如何被选中的,且这些方法局限于可通过删除解决的误差。相反,数据误差可能源于群体性误差,例如缺失记录或系统性取值误差。本文提出 Reptile,一个面向层次化数据的解释系统。给定异常的聚合查询结果,Reptile 推荐下一个下钻属性,并依据将群体统计修复至其期望值对解决异常的贡献程度对下钻群体排序。Reptile 高效训练一个多层次模型,利用数据的层次结构估计期望值,并使用特征矩阵的因数化表示以消除因数据层次结构导致的冗余。我们进一步扩展模型训练以支持因数化数据,并开发了一套利用数据层次结构的优化方法。与基于 Matlab 的实现相比,Reptile 将端到端运行时间减少 6 倍以上,在约翰·霍普金斯大学 COVID-19 数据中正确识别 30 个数据误差中的 21 个,并在一项使用哥伦比亚大学金融工具部门团队的数据与研究人员的用户研究中正确解决 22 项投诉中的 20 项。
引用
@article{arxiv.2103.07037,
title = {Reptile: Aggregation-level Explanations for Hierarchical Data},
author = {Zezhou Huang and Eugene Wu},
journal= {arXiv preprint arXiv:2103.07037},
year = {2021}
}