基于动力系统方法的深度视觉网络训练:超越损失与准确率
计算机视觉与模式识别
2026-04-14 v1 图像与视频处理
摘要
深度视觉识别 model 通常使用 loss 和 accuracy 等指标进行训练和评估。虽然这些 measure 显示模型是否在改进,但它们几乎无法揭示模型在训练期间内部表示如何变化。本文通过动力系统的视角来研究该过程,提出了一种新的分析方法。我们借助最初用于研究生物神经活动的信号分析思想,从训练各阶段收集的各层激活值中定义了三个 measure:反映各层之间长程协同的 integration score、捕捉网络在更同步状态与较不同步状态之间灵活转换能力的 metastability score,以及综合的 dynamical stability index。我们将该 framework 应用于九种 model architecture 与 dataset 的组合,包括多个 ResNet 变体、DenseNet-121、MobileNetV2、VGG-16 以及在 CIFAR-10 和 CIFAR-100 上使用的预训练 Vision Transformer。结果表明,主要有三个模式:首先,integration measure 在较易的 CIFAR-10 设置与较难的 CIFAR-100 设置之间保持一致的区分;其次,stability index 的 volatility 变化可能在 accuracy 完全平台化之前提供收敛的早期信号;最后,integration 与 metastability 之间的关系似乎反映了不同训练行为的风格。总体而言,本 study 提供了一种探索性但有前景的新方法,用以超越 loss 和 accuracy 理解深度视觉训练。
关键词
引用
@article{arxiv.2604.09715,
title = {MuPPet: Multi-person 2D-to-3D Pose Lifting},
author = {Thomas Markhorst and Zhi-Yi Lin and Jouh Yeong Chew and Jan van Gemert and Xucong Zhang},
journal= {arXiv preprint arXiv:2604.09715},
year = {2026}
}
备注
Accepted at CVPRw 2026