超越多选:面向鲁棒视觉语言 RFT 的可验证开放式问答
计算与语言
2025-11-25 v2 人工智能
摘要
多选问答 (MCQA) 作为评估和强化微调 (RFT) 现代多模态语言模型的流行格式,其受限的输出格式允许简化、确定性的自动验证。然而,我们发现选项可能泄露可被利用的信号,这会导致准确度指标不可靠地反映真实能力,并鼓励在 RFT 期间进行显式或隐式的答案猜测行为。我们提出了 ReVeL (Rewrite and Verify by LLM),一个在尽可能多的情况下保持答案可验证的框架,将多选问题重写为开放式问题。该框架根据不同的答案类型进行分类,分别应用不同的重写和验证方案。在用于 RFT 时,我们转换了 2 万个 MCQA 示例,并使用 GRPO 对 Qwen2.5-VL 模型进行微调。基于 ReVeL-OpenQA 训练的模型在多选基准测试中保持与 MCQA 相同的准确率,并将开放式问答准确率提高约六个百分点,表明其在数据效率和更健壮的奖励信号方面优于基于 MCQA 的训练。当用于评估时,ReVeL 也揭示了 MCQA 基准相对于开放式问答的得分膨胀可达高达 20 个百分点,提高了判断准确率,并减少了成本和延迟。我们将公开发布代码和数据。
引用
@article{arxiv.2511.17405,
title = {Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT},
author = {Yesheng Liu and Hao Li and Haiyu Xu and Baoqi Pei and Jiahao Wang and Mingxuan Zhao and Jingshu Zheng and Zheqi He and JG Yao and Bowen Qin and Xi Yang and Jiajun Zhang},
journal= {arXiv preprint arXiv:2511.17405},
year = {2025}
}
备注
Project url: https://flageval-baai.github.io/ReVeL/