中文

大型语言模型在对话中的误导性助理

计算与语言 2024-07-17 v1 人工智能 计算机与社会

摘要

大型语言模型(LLMs)能够在广泛的信息寻求任务中提供帮助。然而,模型输出可能是误导性的,无论是由于无意还是刻意的欺骗。我们利用LLMs作为人类用户的代理,研究其在提供阅读理解任务帮助方面的欺骗能力。我们比较了三种情形的 outcomes:(1)模型被提示提供真实帮助,(2)模型被提示提供微妙的误导,(3)模型被提示为错误答案辩护。我们的实验表明,GPT-4能够有效地误导GPT-3.5-Turbo和GPT-4,导致在该任务上的准确率下降最高可达23%。我们还发现,为用户模型提供来自段落的额外上下文可部分缓解误导模型的影响。本工作凸显了LLMs产生误导性信息的能力,以及这可能在现实世界情境中的影响。

关键词

引用

@article{arxiv.2407.11789,
  title  = {Large Language Models as Misleading Assistants in Conversation},
  author = {Betty Li Hou and Kejian Shi and Jason Phang and James Aung and Steven Adler and Rosie Campbell},
  journal= {arXiv preprint arXiv:2407.11789},
  year   = {2024}
}

备注

Next Generation of AI Safety Workshop, 41st International Conference on Machine Learning (ICML 2024)