中文

大型语言模型如何在诚实与助人之间权衡取舍?

计算与语言 2024-02-14 v2 人工智能 机器学习

摘要

在日常交流中,人们为了最大限度地帮助听者,常常会近似地陈述事实——例如,取整时间或省略细节。大型语言模型(LLMs)如何处理这种微妙的权衡?为了回答这个问题,我们使用旨在刻画人类行为的心理学模型和实验来分析LLMs。我们测试了一系列LLMs,并探索了针对人类偏好的优化或推理时推理如何影响这些权衡。我们发现,基于人类反馈的强化学习同时提高了诚实性和助人性,而思维链提示则使LLMs偏向于助人性而非诚实性。最后,GPT-4 Turbo展示了类似人类的响应模式,包括对会话框架和听者决策情境的敏感性。我们的发现揭示了LLMs内化的对话价值观,并表明即使是这些抽象的价值观,在一定程度上也可以通过零样本提示来引导。

关键词

引用

@article{arxiv.2402.07282,
  title  = {How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?},
  author = {Ryan Liu and Theodore R. Sumers and Ishita Dasgupta and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2402.07282},
  year   = {2024}
}