中文

骗我,骗我:用户对大型语言模型错误陈述的态度

计算与语言 2024-12-17 v1

摘要

尽管大型语言模型(LLM)已成为各个领域的核心工具,但它们常常提供不准确或错误的信息。本研究考察了用户对LLM错误回答的偏好。具体来说,我们评估了用户对明确标记错误陈述的LLM回答与未标记回答的偏好,以及对自信的错误陈述与LLM承认缺乏知识的免责声明的偏好。此外,我们还研究了要求用户评估陈述真实性如何影响这些偏好。令人惊讶的是,61%的用户更喜欢未标记的错误回答而非标记的回答,69%的用户更喜欢自信的错误陈述而非LLM承认缺乏知识。在所有实验中,共有300名用户参与,为我们的分析和结论提供了宝贵的数据。当用户被要求评估陈述的真实性时,对未标记和错误回答的偏好略有下降,但仍然很高。这些发现表明,通过反馈机制影响LLM训练的用户偏好,可能无意中鼓励了错误陈述的生成。未来的研究应解决将LLM行为与这类偏好对齐的伦理和实践影响。

关键词

引用

@article{arxiv.2412.11625,
  title  = {Fool Me, Fool Me: User Attitudes Toward LLM Falsehoods},
  author = {Diana Bar-Or Nirman and Ariel Weizman and Amos Azaria},
  journal= {arXiv preprint arXiv:2412.11625},
  year   = {2024}
}

备注

11 pages, 5 figures, 5 tables