中文

HKD4VLM:面向视觉-语言模型鲁棒多模态幻觉与事实性检测的渐进混合知识蒸馏框架

计算机视觉与模式识别 2025-06-18 v2 多媒体

摘要

随着视觉-语言模型(VLM)的快速发展,大规模多模态模型的负责任行为已成为一个突出的研究领域,特别关注幻觉检测和事实性核查。在本文中,我们提出了负责任人工智能挑战赛两个赛道的解决方案。来自通用领域的启示表明,一个较小的蒸馏 VLM 往往可以优于在下游任务上直接微调的更大 VLM,同时实现更高的效率。因此,我们从知识蒸馏的角度联合处理两个任务,并提出了一种名为 HKD4VLM 的渐进混合知识蒸馏框架。具体而言,整体框架可分解为金字塔式渐进在线蒸馏和三元耦合精细化蒸馏,从粗粒度知识对齐到细粒度精细化逐层推进。此外,我们进一步引入映射偏移增强推理和多样化增强策略以提升模型性能和鲁棒性。广泛的实验结果证明了 HKD4VLM 的有效性。消融研究揭示了驱动性能提升的关键设计选择。

关键词

引用

@article{arxiv.2506.13038,
  title  = {HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs},
  author = {Zijian Zhang and Xuecheng Wu and Danlei Huang and Siyu Yan and Chong Peng and Xuezhi Cao},
  journal= {arXiv preprint arXiv:2506.13038},
  year   = {2025}
}