中文

利用双重正则池化方案从池化数据中高效近似恢复

机器学习 2023-03-02 v1 分布式、并行与集群计算 信息论 math.IT

摘要

在池化数据问题中,给定 nn 个具有隐藏状态位(0或1)的智能体。隐藏状态未知,可视为底层真值 σ\sigma。为揭示该真值,我们给定一种每次查询多个智能体的查询方法。每次查询报告被查询智能体状态之和。我们的目标是用尽可能少的查询学习隐藏状态位。迄今,多数文献处理所有隐藏状态位的精确重建。我们研究一种更宽松的变体,允许一小部分智能体被错误分类。这在池化数据问题的含噪变体中尤为相关,其中查询结果受随机噪声影响。在此设定下,我们提供一种将智能体分配给查询的双重正则测试设计。针对该设计,我们分析了一种以贪心方式估计隐藏位的近似重建算法。我们严格分析了算法的性能、错误概率及其近似质量。作为主要技术新颖点,我们的分析在噪声程度与 σ\sigma 的稀疏性上是一致的。最后,仿真支持了我们的理论发现,并提供了算法在现实样本量下表现良好的有力经验证据。

关键词

引用

@article{arxiv.2303.00043,
  title  = {Efficient Approximate Recovery from Pooled Data Using Doubly Regular Pooling Schemes},
  author = {Max Hahn-Klimroth and Dominik Kaaser and Malin Rau},
  journal= {arXiv preprint arXiv:2303.00043},
  year   = {2023}
}