中文

过度自信且对细节一无所知:通过归纳偏好学习修复提示词不敏感问题

计算与语言 2026-05-12 v2

摘要

视觉与语言模型经常忽略语义上关键的输入编辑,依赖于预训练先验。例如,模型会自信地断言五条腿的狗有四条腿;因此,在 VLMBias 数据集上,GPT-5.2 和 Claude Sonnet 4.6 的准确率分别仅为 4.6%4.6\%0%0\%。现有方法通过构建覆盖欠代表性输入的数据集来调整策略函数 π(yx)\pi(y \mid x)(其中 xxyy 分别指输入提示和响应),但提示词基线方法在 VLMBias 上的提升不足 3%3\%,由于稀有提示词的概率密度较低。为突破这一瓶颈,我们提出了\emph{归纳偏好学习}(abductive preference learning),以优化归纳策略 π(xy)\pi(x \mid y)。我们证明,这放大了前向策略改进,放大系数为 q(y)/p(x)q(y)/p(x),其中 p()p(\cdot)q()q(\cdot) 分别表示提示词和响应的边际概率,从而在最稀有提示词上获得最大提升。此外,我们展示,对于翻译不变的两两偏好学习方法(如 DPO),估计 π(xy)\pi(x \mid y) 可归约为结构数据置换,即比较固定响应下的提示词,无需架构修改。实验上,归纳偏好学习在反事实灵敏度方面取得显著提升:在 VLMBias 上,A-DPO 将准确率从 3%3\% 提升至 44%44\%(提升 1414 倍),超越 GPT-5.2(4.6%4.6\%)和所有闭源 VLM 仅次于 Gemini~3~Flash;在 Inverse-IFEval 上,Multi-DPOP 达到 6565--84%84\%,在 9B 参数规模下超越 GPT-5(73.7%73.7\%),且保持 IFBench,而 DPO 则使之下降 88--12%12\%

关键词

引用

@article{arxiv.2510.09887,
  title  = {Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning},
  author = {Yijin Ni and Simon Yu and Peng Qi},
  journal= {arXiv preprint arXiv:2510.09887},
  year   = {2026}
}