SelfPrompt:基于域约束知识指南与精炼对抗提示的自主评估LLM鲁棒性
计算与语言
2024-12-03 v1 人工智能
摘要
传统方法常依赖标准化基准测试来评估大语言模型(LLM)的鲁棒性,这会增加成本并限制在不同领域的评估。本文引入了新的框架,通过整合精炼对抗提示和域约束知识指南(以知识图形式)来自主评估LLM的鲁棒性。该方法系统地从域约束知识图三元组中生成描述性句子,以构建对抗提示,增强评估的相关性和挑战性。这些由LLM自身生成的、针对其自身鲁棒性进行评估的提示经过严格的过滤和精炼过程,确保仅使用文本流畅性和语义忠实性高的提示。这种自评估机制使LLM无需依赖外部基准即可评估其鲁棒性。我们通过在ChatGPT等专有模型以及Llama-3.1、Phi-3和Mistral等开源模型上的广泛测试,验证了框架的有效性。结果表明,我们的方法不仅减少了对常规数据的依赖,还提供了在受限领域中高效且有针对性的LLM鲁棒性评估方式。
引用
@article{arxiv.2412.00765,
title = {SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts},
author = {Aihua Pei and Zehua Yang and Shunan Zhu and Ruoxi Cheng and Ju Jia},
journal= {arXiv preprint arXiv:2412.00765},
year = {2024}
}