中文

PromptCD:基于极性提示对比解码实现测试时行为增强

人工智能 2026-02-25 v1

摘要

可靠的人工智能系统需要大语言模型(LLM)展现出与人类偏好和价值观相一致的行为。然而,大多数现有的对齐方法都在训练阶段运行,依赖额外的高质量数据,造成显著的计算和标注成本。虽然近期的研究表明,对比解码可以利用模型的内部分布来改进特定能力,但其适用性仍仅限于狭窄的行为范围和场景。本文引入了极性提示对比解码(Polarity-Prompt Contrastive Decoding,PromptCD),一种测试时行为控制方法,将对比解码推广到更广泛的增强设置。PromptCD 为目标行为构建一对正负引导提示,并对比模型响应——具体而言,是对LLM中基于token的概率分布以及VLM中基于注意力模式的响应——以强化可取的结果。该表述将对比解码扩展到广泛的增强目标,适用于LLM和视觉语言模型(VLM),且无需额外训练。对于LLM,在“3H”对齐目标(帮助fulness、honesty和harmlessness)上的实验显示出一致且显著的改进,表明经过微调的模型能够仅在测试时实现有意义的自我增强。对于VLM,我们进一步分析了对视觉注意力的对比效应,显示PromptCD通过强化行为一致的视觉 grounding显著提高了VQA性能。总体而言,这些结果凸显了PromptCD作为一种简单、通用且高效的策略,能够在跨模态环境中实现可靠的行为控制。

关键词

引用

@article{arxiv.2602.20696,
  title  = {PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding},
  author = {Baolong Bi and Yuyao Ge and Shenghua Liu and Yuchen He and Siqian Tong and Lizhe Chen and Lingrui Mei and Zehao Li and Yiwei Wang and Yujun Cai and Ming-Hsuan Yang and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2602.20696},
  year   = {2026}
}