标点何其重要:LLM提示鲁棒性方法的大规模比较
计算与语言
2025-08-18 v1 人工智能
摘要
大型语言模型(LLMs)对提示措辞和格式中的细微、非语义变体极其敏感。本文在统一的实验框架内,系统评估了5种提高提示鲁棒性的方法。我们在来自Llama、Qwen和Gemma系列的8个模型上,对这些技术进行基准测试,涵盖来自Natural Instructions数据集的52个任务。我们的评估覆盖来自微调和基于情境学习范例的鲁棒性方法,并测试其对多种分布迁移的泛化能力。最后,我们扩展分析至GPT-4.1和DeepSeek V3,以评估前沿模型对格式扰动的当前鲁棒性。我们的发现为在实际应用中实现稳定可靠的LLM性能提供了可操作性见解,使实践者能够作出明智的决策,以选择合适的鲁棒性方法。代码:https://github.com/AIRI-Institute/when-punctuation-matters。
引用
@article{arxiv.2508.11383,
title = {When Punctuation Matters: A Large-Scale Comparison of Prompt Robustness Methods for LLMs},
author = {Mikhail Seleznyov and Mikhail Chaichuk and Gleb Ershov and Alexander Panchenko and Elena Tutubalina and Oleg Somov},
journal= {arXiv preprint arXiv:2508.11383},
year = {2025}
}