用 NERO(轨道上的非等变揭示)评估机器学习模型:揭示非等变性
机器学习
2023-06-01 v1
摘要
恰当的评估对于更好地理解、排查、解释模型行为并进一步提升模型性能至关重要。虽然使用基于标量的误差度量提供了快速概览模型性能的途径,但它们往往过于抽象而难以展现某些薄弱环节,且缺乏关于模型重要属性(如鲁棒性)的信息。这不仅阻碍机器学习模型变得更具可解释性和获得信任,也可能对模型开发者和用户产生误导。此外,常规评估流程常使研究者不清楚模型在何处及如何失败,从而复杂化了模型比较与后续开发。为解决这些问题,我们提出一种新颖的评估工作流,名为轨道上的非等变揭示(Non-Equivariance Revealed on Orbits, NERO)评估。NERO 评估的目标是将焦点从传统的基于标量的度量转向评估和可视化模型的等变性,紧密捕捉模型鲁棒性,并允许研究者快速探究有趣或意外的模型行为。NERO 评估由一个任务无关的交互式界面和一组称为 NERO 图的 visualizations 组成,可揭示模型的等变属性。关于 NERO 评估如何应用于多个研究领域的案例研究,包括 2D 数字识别、目标检测、粒子图像测速(PIV)和 3D 点云分类,表明 NERO 评估可快速刻画不同的模型等变性,并通过模型输出的交互式可视化有效解释模型行为。此外,我们提出以共识(consensus)作为真值的替代用于 NERO 评估,以便在使用新的未标注数据集时仍能评估模型等变性。
引用
@article{arxiv.2305.19889,
title = {Evaluating Machine Learning Models with NERO: Non-Equivariance Revealed on Orbits},
author = {Zhuokai Zhao and Takumi Matsuzawa and William Irvine and Michael Maire and Gordon L Kindlmann},
journal= {arXiv preprint arXiv:2305.19889},
year = {2023}
}