中文

通过决策模糊性引导的强化微调改进小样本变化检测视觉问答

计算机视觉与模式识别 2026-01-01 v1

摘要

变化检测视觉问答(CDVQA)要求通过推理双时相遥感图像中的语义变化来回答文本查询。一种直接的方法是通过监督微调(SFT)利用通用视觉-语言模型来提升CDVQA性能。尽管近期取得了进展,但我们观察到,相当一部分失败并非源于明显错误的预测,而是源于决策模糊性,即模型对正确答案和强干扰项赋予相似的置信度。为了形式化这一挑战,我们将决策模糊样本(DAS)定义为真实答案与最具竞争力的备选答案之间概率差距很小的实例。我们认为,显式优化DAS对于提高CDVQA模型的判别能力和鲁棒性至关重要。为此,我们提出了DARFT,一个决策模糊性引导的强化微调框架,该框架首先使用SFT训练的参考策略挖掘DAS,然后在挖掘出的子集上应用组相对策略优化。通过利用多样本解码和组内相对优势,DARFT抑制了强干扰项并锐化了决策边界,无需额外监督。大量实验表明,在SFT基线上取得了持续提升,尤其是在小样本设置下。

关键词

引用

@article{arxiv.2512.24591,
  title  = {Improving Few-Shot Change Detection Visual Question Answering via Decision-Ambiguity-guided Reinforcement Fine-Tuning},
  author = {Fuyu Dong and Ke Li and Di Wang and Nan Luo and Yiming Zhang and Kaiyu Li and Jianfei Yang and Quan Wang},
  journal= {arXiv preprint arXiv:2512.24591},
  year   = {2026}
}