非参数双样本测试的统一数据表示学习
机器学习
2025-05-09 v2 机器学习
摘要
在非参数双样本测试中,学习有效的数据表示至关重要。常见方法会将数据分为训练集和测试集,然后仅在训练集上学习数据表示。然而,最近的理论研究表明,只要在学习过程中不使用样本索引,即可使用全部数据来学习数据表示,同时控制 Type-I 错误。上述事实激励我们在测试中使用测试集(但不使用样本索引)来促进数据表示的学习。为此,我们提出了一种表示学习双样本测试(RL-TST)框架。RL-TST 首先在整个数据集上进行纯自监督表示学习,以捕获数据固有的表示(IRs),这些表示反映了数据底层流形。随后,在这些 IRs 上训练判别模型,以学习判别性表示(DRs),使该框架能够同时利用 IRs 的丰富结构信息和 DRs 的判别能力。大量实验表明,RL-TST 通过同时利用测试集中的数据流动信息和通过寻找具有训练集 DRs 来增强测试功效,显著优于代表性方法。
引用
@article{arxiv.2412.00613,
title = {A Unified Data Representation Learning for Non-parametric Two-sample Testing},
author = {Xunye Tian and Liuhua Peng and Zhijian Zhou and Mingming Gong and Arthur Gretton and Feng Liu},
journal= {arXiv preprint arXiv:2412.00613},
year = {2025}
}
备注
19 pages, 3 figures. To appear in Proceedings of the Fourty-First Conference on Uncertainty in Artificial Intelligence (UAI 2025)