机器学习模型在真实环境中的鲁棒性、评估与自适应
机器学习
2023-03-07 v1 人工智能
摘要
我们的目标是提升部署在真实环境中的机器学习(ML)系统的可靠性。当测试样本与训练样本相似时,ML 模型表现极佳。然而,真实世界应用要求在任何测试样本分布下均能运行。当前的 ML 系统可能在具有分布偏移的测试样本上静默失败。为提升 ML 模型因协变量或域偏移导致的可靠性,我们提出使模型能够:(a) 泛化至更大的测试分布族,(b) 在分布偏移下评估准确率,(c) 自适应至目标分布。我们研究域偏移导致鲁棒性受损的原因,并提出训练域鲁棒模型的算法。模型脆弱的一个关键来源是域过拟合,我们的新训练算法抑制了它,转而鼓励域通用假设。尽管在某些问题设定下我们相较标准训练方法提升了鲁棒性,ML 系统的性能仍可能随域偏移剧烈变化。开发者和利益相关方理解模型漏洞及输入的操作范围至关重要,这可在部署时即时评估,尽管代价高昂。相反,我们主张主动估计在任意指定的可解释域偏移组合上的准确率曲面以进行性能预测。我们提出一种标签高效估计来解决组合域偏移空间上的估计问题。此外,当发现模型在目标域上性能较差时,传统方法利用目标域资源自适应模型。标准自适应方法假定有充足标注资源,这对已部署模型可能不切实际。我们开启了一项仅使用无标注数据资源的轻量级自适应技术研究,重点关注语言应用。
引用
@article{arxiv.2303.02781,
title = {Robustness, Evaluation and Adaptation of Machine Learning Models in the Wild},
author = {Vihari Piratla},
journal= {arXiv preprint arXiv:2303.02781},
year = {2023}
}
备注
PhD Thesis; 191 pages; Dept of Computer Science, IIT Bombay