对抗事实性:开源大语言模型的实证研究
计算与语言
2025-03-17 v1 密码学与安全
摘要
对抗事实性指的是由对手刻意插入输入提示中的错误信息, characterized by varying levels of expressed confidence。本研究系统评估了当多个开源大语言模型 (LLMs) 面对此类对抗输入时的表现。我们考虑了三级对抗 confidence:strongly confident、moderately confident 和 limited confidence。我们的分析涵盖八个 LLM:LLaMA 3.1 (8B)、Phi 3 (3.8B)、Qwen 2.5 (7B)、Deepseek-v2 (16B)、Gemma2 (9B)、Falcon (7B)、Mistrallite (7B) 和 LLaVA (7B)。实证结果表明,LLaMA 3.1 (8B) 在检测对抗输入方面表现出强大的能力,而 Falcon (7B) 的表现较差。值得注意的是,对大多数模型而言,检测成功率随着对手 confidence 降低而提高;然而,对于 LLaMA 3.1 (8B) 和 Phi 3 (3.8B),随着对抗 confidence 降低,检测性能也下降。进一步分析那些引发最高和最低成功攻击率的查询,揭示对抗攻击在针对较少引用或模糊信息时更有效。
引用
@article{arxiv.2503.10690,
title = {Battling Misinformation: An Empirical Study on Adversarial Factuality in Open-Source Large Language Models},
author = {Shahnewaz Karim Sakib and Anindya Bijoy Das and Shibbir Ahmed},
journal= {arXiv preprint arXiv:2503.10690},
year = {2025}
}