SoC:用于测试时提示调优的语义正交校准
计算机视觉与模式识别
2026-05-28 v1
摘要
随着视觉语言模型(VLM)在医疗或自动驾驶等关键决策系统中的日益普及,其不确定性估计的校准变得至关重要。然而,这一维度在 VLM 测试时提示调优(TPT)文献中很大程度上未被探索,该文献主要集中于提升其判别性能。最近的最先进方法主张对文本提示嵌入对强制实施完全正交性以增强可分性,从而改善校准。尽管如此,正如我们在本工作中从理论上证明的那样,完全正交约束的固有梯度会强烈推开语义相关的类别,最终使模型过度自信。基于我们的发现,我们提出了语义正交校准,这是一种基于 Huber 的正则化器,它在保持语义邻近性的同时强制实施平滑的原型分离,从而相比先前基于正交性的方法改善了校准。通过全面的实证验证,我们证明了 SoC 持续改善了校准性能,同时保持了具竞争力的判别能力。
引用
@article{arxiv.2601.08617,
title = {SoC: Semantic Orthogonal Calibration for Test-Time Prompt Tuning},
author = {Leo Fillioux and Omprakash Chakraborty and Ismail Ben Ayed and Paul-Henry Cournède and Stergios Christodoulidis and Maria Vakalopoulou and Jose Dolz},
journal= {arXiv preprint arXiv:2601.08617},
year = {2026}
}