中文

你能信赖你的模型评估吗?利用合成测试数据改进模型评估

机器学习 2023-10-26 v1

摘要

在多样且欠代表的子群上评估机器学习模型的性能,对于确保现实应用中的公平性与可靠性至关重要。然而,由于两个主要问题,准确评估模型性能变得具有挑战性:(1) 测试数据稀缺,尤其是针对小型子群;以及 (2) 模型部署环境中可能的分布偏移,其可能与可用测试数据不一致。在这项工作中,我们引入 3S Testing,一个深度生成建模框架,通过为小型子群生成合成测试集并模拟分布偏移来促进模型评估。我们的实验表明,在估计少数子群上以及合理分布偏移下的模型性能时,3S Testing 优于传统基线——包括仅使用真实测试数据。此外,3S 在其性能估计周围提供区间,与现有方法相比展现出对真实值的更优覆盖。总体而言,这些结果提出了一个问题:我们是否需要一种从有限真实测试数据转向合成测试数据的范式转变。

关键词

引用

@article{arxiv.2310.16524,
  title  = {Can You Rely on Your Model Evaluation? Improving Model Evaluation with Synthetic Test Data},
  author = {Boris van Breugel and Nabeel Seedat and Fergus Imrie and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2310.16524},
  year   = {2023}
}

备注

Advances in Neural Information Processing Systems 36 (NeurIPS 2023). Van Breugel & Seedat contributed equally