过度自信且对细节一无所知:通过归纳偏好学习修复提示词不敏感问题
计算与语言
2026-05-12 v2
摘要
视觉与语言模型经常忽略语义上关键的输入编辑,依赖于预训练先验。例如,模型会自信地断言五条腿的狗有四条腿;因此,在 VLMBias 数据集上,GPT-5.2 和 Claude Sonnet 4.6 的准确率分别仅为 和 。现有方法通过构建覆盖欠代表性输入的数据集来调整策略函数 (其中 和 分别指输入提示和响应),但提示词基线方法在 VLMBias 上的提升不足 ,由于稀有提示词的概率密度较低。为突破这一瓶颈,我们提出了\emph{归纳偏好学习}(abductive preference learning),以优化归纳策略 。我们证明,这放大了前向策略改进,放大系数为 ,其中 和 分别表示提示词和响应的边际概率,从而在最稀有提示词上获得最大提升。此外,我们展示,对于翻译不变的两两偏好学习方法(如 DPO),估计 可归约为结构数据置换,即比较固定响应下的提示词,无需架构修改。实验上,归纳偏好学习在反事实灵敏度方面取得显著提升:在 VLMBias 上,A-DPO 将准确率从 提升至 (提升 倍),超越 GPT-5.2()和所有闭源 VLM 仅次于 Gemini~3~Flash;在 Inverse-IFEval 上,Multi-DPOP 达到 --,在 9B 参数规模下超越 GPT-5(),且保持 IFBench,而 DPO 则使之下降 --。
引用
@article{arxiv.2510.09887,
title = {Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning},
author = {Yijin Ni and Simon Yu and Peng Qi},
journal= {arXiv preprint arXiv:2510.09887},
year = {2026}
}