RoParQ:面向对抗改写问题鲁棒性的大语言模型错位对齐
计算与语言
2025-11-27 v1
摘要
大语言模型(LLM)在回答改写后的问题时常表现出不一致,暗示其依赖表层模式而非真正的语义理解。为解决这一局限,本文提出 RoParQ,一个专门用于评估跨改写一致性的基准数据集,针对闭合书籍多选题问答任务构建。该基准数据集源自标准数据集,通过生成改写版本并筛选保留能引发判决模型不一致置信度的样本。我们进一步提出 XParaCon,一种新颖的评估指标,通过衡量问题变体间准确率标准差来量化模型的鲁棒性。此外,我们实现了一种基于推理的、面向改写的监督微调(SFT)策略,以实现模型对语义不变性的对齐。我们的实验表明,这一针对性对齐显著提升了鲁棒性。值得注意的是,经过微调的轻量级模型在鲁棒性方面的表现可与大型预训练模型相当。这些结果凸显了我们方法在缓解表层记忆并培育更可靠、可靠的大语言模型方面的有效性。
引用
@article{arxiv.2511.21568,
title = {RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions},
author = {Minjoon Choi},
journal= {arXiv preprint arXiv:2511.21568},
year = {2025}
}
备注
12 pages, 9 figures, 8 tables