Wild-Time:一个随时间自然分布偏移的基准
机器学习
2023-01-18 v2
摘要
当测试分布不同于训练分布时,便发生分布偏移,它会显著降级部署于真实世界的机器学习模型性能。时间偏移——由时间推移产生的分布偏移——通常逐渐发生,并具有时间戳元数据的额外结构。通过利用时间戳元数据,模型可潜在地从过去分布偏移的趋势中学习并外推至未来。尽管近期工作已研究分布偏移,时间偏移仍未被充分探索。为弥补此缺口,我们策划了 Wild-Time,一个包含 5 个数据集的基准,反映多种真实世界应用(包括患者预后与新闻分类)中出现的时间分布偏移。在这些数据集上,我们系统基准测试了 13 种已有方法,包括域泛化、持续学习、自监督学习与集成学习中的方法。我们使用两种评估策略:固定时间切分评估(Eval-Fix)与数据流评估(Eval-Stream)。Eval-Fix 作为我们的主要评估策略,旨在提供简单评估协议,而 Eval-Stream 对若干真实世界应用更为现实。在两种评估策略下,我们观察到从分布内到分布外数据平均性能下降 20%。现有方法无法弥合此差距。代码见 https://wild-time.github.io/。
引用
@article{arxiv.2211.14238,
title = {Wild-Time: A Benchmark of in-the-Wild Distribution Shift over Time},
author = {Huaxiu Yao and Caroline Choi and Bochuan Cao and Yoonho Lee and Pang Wei Koh and Chelsea Finn},
journal= {arXiv preprint arXiv:2211.14238},
year = {2023}
}
备注
Accepted by NeurIPS 2022 Track on Datasets and Benchmarks; v2: fixed some issues in FMoW and change the name from "FMoW" to "FMoW-Time"