中文

面向分层分类的层次感知视觉-语言模型精调

计算机视觉与模式识别 2025-12-29 v1 人工智能

摘要

视觉-语言模型(VLMs)通过大规模图像-文本预训练学习到强大的多模态表征,但将其适用于层次化分类的研究仍不足。标准方法将标签视为平坦类别,需进行完整精调,代价高昂且在不同层级之间产生不一致的预测。我们提出一种高效的层次感知精调框架,仅更新少量参数即可实现结构一致性。我们结合两种目标:树形路径 KL 发散(TP-KL)沿真实标签路径对齐预测以实现垂直一致性,同时层次-兄弟光滑交叉熵(HiSCE)鼓励兄弟类别间的预测一致性。这两种损失函数在 VLM 的共享嵌入空间中工作,并与轻量级 LoRA 适配集成。在多个基准测试上实验结果表明,方法在全路径准确率和基于树的不一致误差方面均取得一致改进,同时参数开销最小。我们的 approach 为将 VLMs 适配到结构化分类法提供了一种高效策略。

关键词

引用

@article{arxiv.2512.21529,
  title  = {Hierarchy-Aware Fine-Tuning of Vision-Language Models},
  author = {Jiayu Li and Rajesh Gangireddy and Samet Akcay and Wei Cheng and Juhua Hu},
  journal= {arXiv preprint arXiv:2512.21529},
  year   = {2025}
}