中文

翻转-翻转一致性:面向 LLMs 提示词扰动鲁棒性的无监督训练方法

计算与语言 2025-10-17 v1 机器学习

摘要

大型语言模型(LLMs)面对不同表述的同一提示词时,常常会产生不一致的答案。本文提出一种翻转-翻转一致性(F2CF^2C)方法,通过无监督训练来提高对此类扰动的鲁棒性。F2CF^2C由两个关键组件构成:第一个组件是共识交叉熵(CCE),它通过对提示词变体进行多数投票来生成硬伪标签;第二个组件是表示对齐损失,将低置信度和非多数投票的预测器拉向由高置信度、多数投票变体所确立的共识。我们在覆盖四种 NLP 任务的 11 个数据集上进行评估,每个数据集包含 4-15 种提示词变体。在平均情况下,F2CF^2C将观察到的一致性提升了 11.62%,平均 F1F_1 分数提升 8.94%,在不同格式下的性能方差降低 3.29%。在跨域评估中,F2CF^2C能够有效泛化,提升 F1\overline{F_1} 和一致性,同时降低大多数源-目标对之间的方差。当仅使用部分提示词扰动进行训练并在保留的格式上评估时,F2CF^2C始终能提升性能和一致性,同时降低方差。这些发现表明,F2CF^2C是一种有效的无监督方法,可增强 LLMs 在提示词扰动下的一致性、性能和泛化能力。代码已公开 https://github.com/ParsaHejabi/Flip-Flop-Consistency-Unsupervised-Training-for-Robustness-to-Prompt-Perturbations-in-LLMs

关键词

引用

@article{arxiv.2510.14242,
  title  = {Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs},
  author = {Parsa Hejabi and Elnaz Rahmati and Alireza S. Ziabari and Morteza Dehghani},
  journal= {arXiv preprint arXiv:2510.14242},
  year   = {2025}
}

备注

14 pages, 6 figures, 3 tables, and 1 algorithm