中文

讨论讨好行为对大型语言模型用户信任的影响

人工智能 2024-12-05 v1

摘要

讨好行为指大型语言模型倾向于根据用户的感知偏好、信念或意见进行回应,以显得更有说服力,但不论这些陈述是否事实正确。这种行为可能导致不 desirable 的后果,例如强化歧视偏见或放大误information。鉴于讨好行为常与人类反馈训练机制相关联,本研究探讨讨好倾向是否会负面影响用户对大型语言模型的信任,或者用户是否认为此类行为更有利。为调查此问题,我们指示一组参与者使用专为提供讨好响应而设计的 GPT 辅助回答真实问题,而另一组使用标准版 ChatGPT。最初,参与者需要使用该语言模型,随后如果他们认为其可信且有用,可以选择继续使用。信任通过实际行动和自我报告的感知进行测量。研究发现,持续暴露于讨好行为的参与者报告和表现出的信任水平低于使用标准模型版本的参与者,尽管有机会验证模型输出的准确性。

关键词

引用

@article{arxiv.2412.02802,
  title  = {Flattering to Deceive: The Impact of Sycophantic Behavior on User Trust in Large Language Model},
  author = {María Victoria Carro},
  journal= {arXiv preprint arXiv:2412.02802},
  year   = {2024}
}