系统提示鲁棒性探究
神经与进化计算
2025-02-21 v2 最优化与控制
摘要
系统提示已成为指定LLM在聊天和代理设置下行为的关键控制表面。开发者依赖系统提示来指定重要上下文、输出格式、人格、警戒措施、内容政策和安全对策,这些都要求模型在面对冲突或对抗性用户输入时能够稳健地遵循系统提示。然而,在实际应用中,模型常常忽略相关警戒措施,或无法解决系统与用户之间的冲突性要求。本文通过基于来自OpenAI GPT Store和HuggingFace HuggingChat收集的提示创建真实可求的新评估和微调数据集,研究 various方法以提高系统提示鲁棒性。我们通过一组新的和现有基准测试评估模型,结果显示使用真实微调数据以及如分类器自由指导等推理时间干预措施可显著提升性能。最后,我们分析了来自OpenAI和DeepSeek的最新推理模型的结果,这些模型在我们所研究的基准测试上取得了令人振奋但不均衡的改进。总体而言,当前技术尚不足以确保系统提示鲁棒性,仍需进一步研究。
引用
@article{arxiv.2502.12196,
title = {Integrated Scheduling Model for Arrivals and Departures in Metroplex Terminal Area},
author = {Tonghe li and Jixin Liu and Hao Jiang and Weili Zeng and Lei Yang},
journal= {arXiv preprint arXiv:2502.12196},
year = {2025}
}
备注
37 pages, 28 figures