CF-VLM:反事实视觉语言微调
机器学习
2025-06-24 v1 人工智能
摘要
近期的视觉语言模型(VLM)进展大幅提升了跨模态语义理解能力,但在细粒度区分和深层因果推理任务方面仍存在显著局限。现有的VLM往往依赖浅层统计相关性,缺乏捕捉视觉内容与文本内容之间底层因果逻辑的能力。为此,我们提出反事实视觉语言微调(CF-VLM),一种通过针对性地使用反事实样本来增强VLM因果推理能力的新框架。CF-VLM引入三个互补的训练目标:维持基础的跨模态对齐,强化事实场景表征相对于一致的反事实场景的唯一性和稳定性,以及锐化模型对最小但关键因果编辑的敏感性。广泛的实验表明,CF-VLM在组合推理和泛化基准测试中 consistently 优于强大的基线和最先进的方法。此外,它在缓解视觉幻觉方面也显示出潜力,表明事实一致性得到改善。我们的CF-VLM为在需要可靠推理和可解释性的高风险实际场景中部署VLM提供了稳健的基础。
引用
@article{arxiv.2506.17267,
title = {CF-VLM:CounterFactual Vision-Language Fine-tuning},
author = {Jusheng Zhang and Kaitong Cai and Yijia Fan and Jian Wang and Keze Wang},
journal= {arXiv preprint arXiv:2506.17267},
year = {2025}
}