中文

非参数双样本测试的统一数据表示学习

机器学习 2025-05-09 v2 机器学习

摘要

在非参数双样本测试中,学习有效的数据表示至关重要。常见方法会将数据分为训练集和测试集,然后仅在训练集上学习数据表示。然而,最近的理论研究表明,只要在学习过程中不使用样本索引,即可使用全部数据来学习数据表示,同时控制 Type-I 错误。上述事实激励我们在测试中使用测试集(但不使用样本索引)来促进数据表示的学习。为此,我们提出了一种表示学习双样本测试(RL-TST)框架。RL-TST 首先在整个数据集上进行纯自监督表示学习,以捕获数据固有的表示(IRs),这些表示反映了数据底层流形。随后,在这些 IRs 上训练判别模型,以学习判别性表示(DRs),使该框架能够同时利用 IRs 的丰富结构信息和 DRs 的判别能力。大量实验表明,RL-TST 通过同时利用测试集中的数据流动信息和通过寻找具有训练集 DRs 来增强测试功效,显著优于代表性方法。

关键词

引用

@article{arxiv.2412.00613,
  title  = {A Unified Data Representation Learning for Non-parametric Two-sample Testing},
  author = {Xunye Tian and Liuhua Peng and Zhijian Zhou and Mingming Gong and Arthur Gretton and Feng Liu},
  journal= {arXiv preprint arXiv:2412.00613},
  year   = {2025}
}

备注

19 pages, 3 figures. To appear in Proceedings of the Fourty-First Conference on Uncertainty in Artificial Intelligence (UAI 2025)