通过轨迹感知过程监督改进医学视觉问答
机器学习
2026-05-07 v1 计算机视觉与模式识别
摘要
推理能力是可靠医学视觉问答(VQA)的关键因素,但现有数据集很少包含推理解释。我们通过使用开源视觉语言模型和COMCTS算法为六个医学VQA基准生成推理轨迹,由LLM作为验证裁判。基于这些生成的数据集,我们提出一个两阶段训练框架:监督微调 followed by基于新颖过程奖励的群体相对策略优化(GRPO)。虽然标准方法仅依赖最终答案的精确匹配奖励,但我们引入一种轨迹感知奖励,用于衡量生成推理过程与真实推理过程之间的相似性。具体而言,我们使用句子转换器嵌入推理步骤,并计算其向量序列之间的动态时间变形(DTW)距离。在六个基准上的实验表明,将DTW基于过程奖励与精确匹配奖励结合使用,持续优于SFT-only训练,将平均准确率从0.598提高到0.689,平均BERTScore从0.845提高到0.881,平均ROUGE-L从0.665提高到0.748。我们的结果凸显了过程监督在训练具备推理能力的医学VLMs中的重要性。我们将代码和生成的推理数据集公开于GitHub。
引用
@article{arxiv.2605.04064,
title = {Improving Medical VQA through Trajectory-Aware Process Supervision},
author = {Halil Ibrahim Gulluk and Olivier Gevaert},
journal= {arXiv preprint arXiv:2605.04064},
year = {2026}
}