无数据增强小型自然图像分类的层次化推理模型探索
计算机视觉与模式识别
2025-10-07 v1 机器学习
摘要
本文探讨了层次化推理模型(HRM)——包含两个 Transformer 风格模块()、一步(DEQ 风格)训练、深度监督、旋转位置嵌入和 RMSNorm——是否可作为实用图像分类器。它在 MNIST、CIFAR-10 和 CIFAR-100 上进行评估,处于刻意的原始方案下:无数据增强、相同的优化器家族使用一个 epoch 的 warmup 然后余弦底衰减、以及标签平滑。HRM 在 MNIST(约 98% 测试准确率)上优化稳定且表现良好,但在小型自然图像上过拟合且泛化不足:在 CIFAR-10 上,HRM 在 25 个 epoch 后达到 65.0%,而两个阶段的 Conv--BN--ReLU 基线在约 30 倍更快的每个 epoch 训练速度下达到 77.2%;在 CIFAR-100 上,HRM 仅实现 29.7% 测试准确率 Despite 91.5% train accuracy,而相同的 CNN 达到 45.3% test with 50.5% train accuracy。损失轨迹和误差分析表明优化健康,但 HRM 在此方案下缺乏针对图像的特定归纳偏置。因此,对于在无增强情况下进行小分辨率图像分类,HRM 当前不具备与甚至简单卷积架构的竞争力,但这不排除模型修改后大幅提升的可能性。
关键词
引用
@article{arxiv.2510.03598,
title = {Exploring the Hierarchical Reasoning Model for Small Natural-Image Classification Without Augmentation},
author = {Alexander V. Mantzaris},
journal= {arXiv preprint arXiv:2510.03598},
year = {2025}
}