减少面向自动驾驶VLMs的合成MCQAs中的文本偏见
机器学习
2026-02-23 v1 计算与语言
机器人学
摘要
多选题问答(MCQA)基准是衡量视觉语言模型(VLM)在驾驶任务中性能的已确立标准。然而,我们注意到合成生成的MCQAs高度易受隐藏文本线索影响,允许模型通过利用语言模式而非视觉上下文来实现高准确率。我们的结果表明,针对此类数据微调的VLM即使没有视觉输入即可实现相当于人类验证基准的准确率。我们提出的方法将盲目准确率从随机+66.9%降低到+2.9%,消除绝大多数可利用的文本捷径。通过将正确答案与语言artifacts解耦并采用课程学习策略,我们迫使模型依赖视觉 grounding,确保其性能准确反映感知理解。
引用
@article{arxiv.2602.17677,
title = {Reducing Text Bias in Synthetically Generated MCQAs for VLMs in Autonomous Driving},
author = {Sutej Kulgod and Sean Ye and Sanchit Tanwar and Christoffer Heckman},
journal= {arXiv preprint arXiv:2602.17677},
year = {2026}
}
备注
7 pages, 2 figures