在测试时使用强化学习改变模型行为
机器学习
2017-02-28 v1 机器学习
摘要
机器学习模型通常在测试时面临训练时不存在的约束和权衡。例如,在嵌入式设备上运行的计算机视觉模型可能需要执行实时推理,或者在手机上运行的翻译模型可能希望限制其平均计算时间以提高能效。在这项工作中,我们描述了一个混合专家模型,并展示了如何使用强化学习在逐输入的基础上改变其测试时的资源消耗。我们在一个基于 MNIST 的小型示例上测试了我们的方法。
引用
@article{arxiv.1702.07780,
title = {Changing Model Behavior at Test-Time Using Reinforcement Learning},
author = {Augustus Odena and Dieterich Lawson and Christopher Olah},
journal= {arXiv preprint arXiv:1702.07780},
year = {2017}
}
备注
Submitted to ICLR 2017 Workshop Track