充分利用你的样本:利用部分信息的最优无偏估计器
数据库
2015-03-19 v1 数据结构与算法
网络与互联网体系结构
统计理论
统计理论
摘要
随机采样是数据处理与传输中的基本工具。它用于汇总因过大而无法存储或操作的数据,并满足带宽或电池功率等资源约束。应用于样本的估计器有助于对原始数据提出的查询进行快速近似处理,而样本的价值取决于这些估计器的质量。我们的工作针对诸如请求和流量日志以及传感器测量等数据集,这些数据在多个实例(时间段、位置或快照)上重复收集。我们关注跨多个实例的查询,例如对选定记录的不同计数和距离度量。这些查询用于从规划到异常和变化检测的各种应用。无偏低方差估计器特别有效,因为相对误差随选定记录键的数量增加而减小。霍维茨-汤普森估计器已知在“全有或全无”结果(揭示精确值或不提供估计量信息)的采样中最小化方差,但对于一个结果可能提供部分信息的多实例操作而言并非最优。我们提出了一种通用的原则性方法,用于推导采样实例上的(帕累托)最优无偏估计器,并旨在理解其潜力。我们证明了对于常见采样方案,基本查询的估计精度有显著提高。
引用
@article{arxiv.1109.1325,
title = {Get the Most out of Your Sample: Optimal Unbiased Estimators using Partial Information},
author = {Edith Cohen and Haim Kaplan},
journal= {arXiv preprint arXiv:1109.1325},
year = {2015}
}
备注
This is a full version of a PODS 2011 paper