VISTA:基于自蒸馏的验证信息轨迹适应
机器学习
2026-04-15 v1 人工智能
摘要
深度学习模型尽管具有良好的验证准确率,却可能收敛到次优解,从而掩盖了我们称为轨迹偏差的优化失效。这是因为随着训练进行,模型可以为特定数据子群体放弃高泛化状态,从而在不触发经典过拟合信号的情况下丢弃先前学习的潜在特征。为解决此问题,我们引入VISTA,一个在线自蒸馏框架,通过沿优化轨迹强制一致性。使用基于验证的边际覆盖得分,VISTA识别专家锚点,这些锚点是保留对不同数据区域专门能力的早期模型状态。这些锚点覆盖加权集成在线整合训练中,以正则化损�景并保持已掌握的知识。在多个基准测试上评估时,VISTA在标准训练和先前自蒸馈方法之上显示出改进的鲁棒性和泛化能力,而轻量级实现通过减少 90% 的存储开销而不损失性能。
引用
@article{arxiv.2604.12044,
title = {VISTA: Validation-Informed Trajectory Adaptation via Self-Distillation},
author = {Eli Corn and Daphna Weinshall},
journal= {arXiv preprint arXiv:2604.12044},
year = {2026}
}