任务先验:通过考虑整个下游任务空间来增强模型评估
机器学习
2025-10-22 v3 人工智能
摘要
人工智能研究的终极目标,特别是自监督学习(SSL),是要生产能成功解决任何可能任务的系统。相比之下,当前可供 AI 研究者使用的评估方法通常依赖于固定的手工挑选的下游基准集合。因此,大量精力被用于设计和搜索能够作为我们终极目标代理的大量评估任务集合。我们认为,这种僵化的评估协议在 AI 研究中制造了隐性瓶颈。为此,我们定义了通过采用任务分布并定义任务先验(Task Priors)来获得的下游任务概率空间。在此视图下,可以在所有可能的下游任务集合上对模型性能进行评估。我们的框架首次为关键问题提供了答案,例如:(i)我的模型在所有可能的下游任务上的平均性能如何(按遇见每个任务的概率加权)?或(ii)在定义的任务先验下,我的模型在所有下游任务上的性能方差为多少?除了建立新的评估标准之外,我们相信任务先验将推动 SSL 研究的进展——因为下游任务评估是研究者唯一可获得的定性信号。
引用
@article{arxiv.2507.09871,
title = {Task Priors: Enhancing Model Evaluation by Considering the Entire Space of Downstream Tasks},
author = {Niket Patel and Randall Balestriero},
journal= {arXiv preprint arXiv:2507.09871},
year = {2025}
}
备注
NeurIPS UniReps Workshop 2025