关于可适应选择浓缩查询的紧致界限
数据结构与算法
2025-11-13 v2 机器学习
摘要
大多数关于自适应数据分析的工作都假设数据集中的样本是独立的。当允许相关性时,即使在非自适应设置下,除非某些结构约束被施加,否则问题可能变得难以处理。为此,Bassily和Freund[2016]引入了浓缩查询框架,该框架要求分析师限制自己仅使用围绕其预期值浓缩的查询。虽然这一假设在非自适应设置下使问题变得平凡,但在自适应设置下仍然颇具挑战性。事实上,已知的所有算法在该框架下支持的查询数量显著少于独立情况下的查询数量:对于大小为n的样本,最多仅支持O(n)个查询,而在独立设置下可支持O(n^2)个查询。本文我们证明,在当前浓缩查询框架的条件下,此效用差距是固有的。此外,我们还呈现一个简化版的最佳已知算法,与我们的不可实现结果相吻合。
引用
@article{arxiv.2507.13700,
title = {Tight Bounds for Answering Adaptively Chosen Concentrated Queries},
author = {Emma Rapoport and Edith Cohen and Uri Stemmer},
journal= {arXiv preprint arXiv:2507.13700},
year = {2025}
}