大语言模型能否提供安全与隐私建议?衡量 LLMs 反驳错误观念的能力
人机交互
2023-10-05 v1 计算与语言
摘要
用户从在线资源(包括可信网站和内容分享平台)寻求安全与隐私(S&P)建议。这些资源帮助用户理解 S&P 技术与工具,并给出可操作的策略。大语言模型(LLMs)近期已成为可信的信息来源。然而,其准确性与正确性受到质疑。先前研究已概述了 LLMs 在回答选择题方面的不足,以及用户可能无意中规避模型限制(例如生成有毒内容)的能力。然而,LLMs 提供可靠 S&P 建议的能力尚未得到充分探索。在本文中,我们衡量它们反驳公众普遍持有的流行 S&P 错误观念的能力。我们首先研究近期学术文献,整理出涵盖六个不同主题、超过一百条 S&P 相关错误观念的数据集。随后我们查询两个流行的 LLMs(Bard 和 ChatGPT),并制定标注指南来评估它们对这些错误观念的回应。为全面评估其回应,我们进一步采用三种策略:多次查询每条错误观念、生成并查询其改写版本、以及索取回应的来源 URL。两个模型平均表现出 21.3% 不可忽略的错误率,错误地支持了流行的 S&P 错误观念。当我们用相同或改写的错误观念重复查询 LLMs 时,错误率上升至 32.6%。我们还发现模型可能部分支持某错误观念或保持不表态,拒绝就错误观念采取明确立场。我们对回应信息来源的探索揭示,LLMs 容易提供无效 URL(Bard 为 21.2%,ChatGPT 为 67.7%)或指向不相关来源(Bard 返回 44.2%,ChatGPT 返回 18.3%)。
引用
@article{arxiv.2310.02431,
title = {Can Large Language Models Provide Security & Privacy Advice? Measuring the Ability of LLMs to Refute Misconceptions},
author = {Yufan Chen and Arjun Arunasalam and Z. Berkay Celik},
journal= {arXiv preprint arXiv:2310.02431},
year = {2023}
}
备注
Accepted to the Annual Computer Security Applications Conference (ACSAC), 2023