边缘预测:识别更大模型表现更优的样本
机器学习
2022-02-16 v1 人工智能
机器学习
摘要
大量工作致力于构建更大且更准确的模型,但相对而言,很少有余力去理解哪些样本从增加的复杂性中受益。在本文中,我们展示并分析了模型对单个样本的预测不确定性,与更大模型在这些样本上改善预测的可能性之间令人惊讶的紧密关联。通过对 T5 编码器-解码器架构的广泛数值研究,我们表明大模型在小型模型最不确定的样本上改进最大。在更确定的样本上,即使是那些小型模型并不特别准确的样本,大模型往往完全无法改进,甚至可能比小型模型表现更差。基于这些发现,我们展示了一种切换模型(switcher model),当小型模型不确定时将样本委派给更大模型,从而能在性能和资源使用上实现显著提升。我们还探索了基于委员会的(committee-based)不确定性度量,其可能更有效但不太实用。
引用
@article{arxiv.2202.07652,
title = {Predicting on the Edge: Identifying Where a Larger Model Does Better},
author = {Taman Narayan and Heinrich Jiang and Sen Zhao and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2202.07652},
year = {2022}
}