通过视觉语言模型中的动态思维链增强多模态关键短语预测
计算机视觉与模式识别
2025-10-13 v1
摘要
多模态关键短语预测(MMKP)旨在通过整合多种输入信息模态来产生一组结论性短语,从而超越仅文本方法。传统多模态方法已被证明在处理具有挑战性的缺失和未见场景方面存在显著局限性。此外,我们发现现有基准存在严重缺陷,由于训练测试中存在大量重叠而高估了模型能力。在这项工作中,我们提出利用视觉语言模型(VLMs)来完成 MMKP 任务。首先,我们使用两种广泛使用的策略,即零样本和监督微调(SFT)来评估 VLMs 的下界性能。接下来,为提升 VLMs 的复杂推理能力,我们采用 Fine-tune-CoT,该方法利用教师模型生成的高质量 CoT 推理数据来微调较小模型。最后,为解决"过度思考"现象,我们提出了一种动态 CoT 策略,在训练期间自适应地注入 CoT 数据,使模型能够在推理阶段灵活利用其推理能力。我们在各种数据集上评估了所提出的策略,实验结果证明了所提出方法的有效性。代码可在 https://github.com/bytedance/DynamicCoT 获取。
引用
@article{arxiv.2510.09358,
title = {Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models},
author = {Qihang Ma and Shengyu Li and Jie Tang and Dingkang Yang and Shaodong Chen and Yingyi Zhang and Chao Feng and Jiao Ran},
journal= {arXiv preprint arXiv:2510.09358},
year = {2025}
}
备注
EMNLP2025. Code is avaible at https://github.com/bytedance/DynamicCoT