翻转-翻转一致性:面向 LLMs 提示词扰动鲁棒性的无监督训练方法
计算与语言
2025-10-17 v1 机器学习
摘要
大型语言模型(LLMs)面对不同表述的同一提示词时,常常会产生不一致的答案。本文提出一种翻转-翻转一致性()方法,通过无监督训练来提高对此类扰动的鲁棒性。由两个关键组件构成:第一个组件是共识交叉熵(CCE),它通过对提示词变体进行多数投票来生成硬伪标签;第二个组件是表示对齐损失,将低置信度和非多数投票的预测器拉向由高置信度、多数投票变体所确立的共识。我们在覆盖四种 NLP 任务的 11 个数据集上进行评估,每个数据集包含 4-15 种提示词变体。在平均情况下,将观察到的一致性提升了 11.62%,平均 分数提升 8.94%,在不同格式下的性能方差降低 3.29%。在跨域评估中,能够有效泛化,提升 和一致性,同时降低大多数源-目标对之间的方差。当仅使用部分提示词扰动进行训练并在保留的格式上评估时,始终能提升性能和一致性,同时降低方差。这些发现表明,是一种有效的无监督方法,可增强 LLMs 在提示词扰动下的一致性、性能和泛化能力。代码已公开 https://github.com/ParsaHejabi/Flip-Flop-Consistency-Unsupervised-Training-for-Robustness-to-Prompt-Perturbations-in-LLMs
引用
@article{arxiv.2510.14242,
title = {Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs},
author = {Parsa Hejabi and Elnaz Rahmati and Alireza S. Ziabari and Morteza Dehghani},
journal= {arXiv preprint arXiv:2510.14242},
year = {2025}
}
备注
14 pages, 6 figures, 3 tables, and 1 algorithm