开源大语言模型的可信度如何?基于恶意演示的评估揭示其脆弱性
计算与语言
2024-04-03 v2 人工智能
摘要
开源大语言模型(LLMs)的快速发展正显著推动人工智能的进步。然而,对其可信度(trustworthiness)的理解仍然有限。在可信度不足的情况下大规模部署这些模型可能带来重大风险,这凸显了及时揭示这些问题的必要性。在本工作中,我们对开源 LLMs 的可信度进行了对抗性评估,从毒性、刻板印象、伦理、幻觉、公平性、谄媚、隐私以及针对对抗性演示的鲁棒性八个不同方面对其进行审视。我们提出了 advCoU,一种扩展的基于话语链(Chain of Utterances, CoU)的提示策略,通过引入精心设计的恶意演示来进行可信度攻击。我们广泛的实验涵盖了近期具有代表性的开源 LLM 系列,包括 Vicuna、MPT、Falcon、Mistral 和 Llama 2。实证结果强调了我们的攻击策略在不同方面的有效性。更有趣的是,我们的结果分析表明,在通用 NLP 任务上性能更优的模型并不总是具有更高的可信度;事实上,更大的模型可能更容易受到攻击。此外,经过指令微调、专注于指令遵循的模型往往更易受影响,尽管为安全对齐而对 LLMs 进行微调被证明能有效缓解对抗性可信度攻击。
引用
@article{arxiv.2311.09447,
title = {How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities},
author = {Lingbo Mo and Boshi Wang and Muhao Chen and Huan Sun},
journal= {arXiv preprint arXiv:2311.09447},
year = {2024}
}
备注
NAACL 2024