锚定特征间隙:用于样本高效表示学习的跨模态谱稳定化
机器学习
2026-05-12 v1 计算机视觉与模式识别
图像与视频处理
摘要
深度视觉模型在低数据场景下性能急剧下降,尤其是在标记样本稀缺的医学影像领域。我们表明,这不仅仅源于过拟合,更源于一种几何失效:有限样本噪声破坏了嵌入协方差,导致特征间隙坍塌,并限制了可恢复的信号承载模态的数量。我们发展了一个有限样本表示学习的谱理论,该理论量化了可恢复维度 K(N),即可以从 N 个样本中稳定估计的特征模态数量。利用微扰理论和集中不等式,我们表明只有特征值高于噪声基底 的模态是可靠的,从而产生一个控制分类性能的截断马氏能量。在幂律谱模型下,该能量可以近似为截断的黎曼 zeta 函数,将特征值衰减与数据效率和 AUC 联系起来。在此框架内,多模态学习充当了谱稳定化的角色:视觉-语言模型施加低秩约束,抑制噪声主导的方向并保留特征间隙,从而在数据稀缺时增加 K(N)。在 MNIST 和多疾病神经影像上,我们表明,即使单模态模型达到了可比的少样本准确率,多模态训练也能维持更稳定的模态并改善类别分离。这些结果将谱坍塌确定为低数据学习中的一个基本瓶颈。我们使用截断马氏能量和 K(N) 来诊断编码器质量,并引入基于 zeta 的谱滤波作为一种提高数据效率的原则性方法。
引用
@article{arxiv.2605.08764,
title = {Anchoring the Eigengap: Cross-Modal Spectral Stabilization for Sample-Efficient Representation Learning},
author = {Nikhil J. Dhinagar and Vidhi Chhatbar and Chirag Jagad and Pavithra Senthilkumar and Sophia I. Thomopoulos and Mahir H. Khan and Sook-Lei Liew and the ENIGMA-Stroke Recovery Working Group and Paul M. Thompson},
journal= {arXiv preprint arXiv:2605.08764},
year = {2026}
}