中文

特权零样本自动机器学习

机器学习 2021-06-28 v1 计算与语言

摘要

本工作通过使用数据集与函数描述,提升了自动化机器学习(AutoML)系统的质量,同时借助零样本方法将计算时间从数分钟显著降至数毫秒。给定一个新的数据集和明确定义的机器学习任务,人类会先阅读数据集描述及待使用算法的文档。本工作是首个将这些文本描述(我们称之为特权信息)用于 AutoML 的研究。我们使用预训练的 Transformer 模型处理特权文本,并证明使用该信息可改善 AutoML 性能。因此,我们的方法利用自然语言处理中无监督表示学习的进展,为 AutoML 提供显著增益。我们证明仅使用数据和函数的文本描述即可获得合理的分类性能,且将文本描述添加到数据元特征上可改善跨表格数据集的分类。为实现零样本 AutoML,我们用这些描述嵌入和数据元特征训练了一个图神经网络。每个节点代表一个训练数据集,我们借此以零样本方式预测新测试数据集的最佳机器学习流水线。我们的零样本方法可快速预测出有监督学习任务和数据集的高质量流水线。相比之下,多数 AutoML 系统需要数十或数百次流水线评估。我们表明零样本 AutoML 在各数据集上一致地将运行与预测时间从分钟降至毫秒。通过将 AutoML 加速数个数量级,本工作展示了实时 AutoML。

关键词

引用

@article{arxiv.2106.13743,
  title  = {Privileged Zero-Shot AutoML},
  author = {Nikhil Singh and Brandon Kates and Jeff Mentch and Anant Kharkar and Madeleine Udell and Iddo Drori},
  journal= {arXiv preprint arXiv:2106.13743},
  year   = {2021}
}

备注

16 pages, 4 figures