面向自适应 LLM:基于 CoIPO 的内在提示噪声鲁棒性
计算与语言
2026-03-05 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 在广泛的任务中展现出卓越且持续提升的性能。然而,LLM 在面对有限开放性或严格输出格式要求的场景时,性能可能对提示变体高度敏感,这表明其鲁棒性不足。在实际应用中,提供给 LLM 的用户提示常常包含瑕疵,这可能损害模型响应的质量。针对此问题,先前的工作主要聚焦于预处理提示,采用外部工具或甚至是 LLM 来对提示 formulation 进行细化。然而,这些方法忽略了 LLM 的内在鲁棒性,且依赖外部组件会引入额外的计算开销和不确定性。本文提出一种基于对比学习的逆向直接偏好优化 (CoIPO) 方法,通过最小化模型在干净提示和其噪声版本下产生的与标签对齐的 logits 之间的差异,并运用互信息理论进行详细分析。我们通过构建每个提示包含一个干净提示及其对应噪声版本的配对提示,来扩充 FLAN 数据集。此外,为评估效果,我们开发了 NoisyPromptBench,这是一个源自现有 PromptBench 并经扩展和衍生的基准测试。在 NoisyPromptBench 上的实验结果表明,我们提出的方法在当前最先进方法的平均准确率上实现了显著提升。CoIPO、配对 FLAN 数据集以及 NoisyPromptBench 的源代码已发布于 https://github.com/vegetable-yx/CoIPO。
引用
@article{arxiv.2603.03314,
title = {Towards Self-Robust LLMs: Intrinsic Prompt Noise Resistance via CoIPO},
author = {Xin Yang and Letian Li and Abudukelimu Wuerkaixi and Xuxin Cheng and Cao Liu and Ke Zeng and Xunliang Cai and Wenyuan Jiang},
journal= {arXiv preprint arXiv:2603.03314},
year = {2026}
}