中文

探索人类-LLM对话:心理模型与毒性的起源

人机交互 2024-07-09 v1 人工智能

摘要

本研究探讨了大型语言模型(LLMs)在多样化、无约束环境中的真实世界人类交互,与大多数前期研究不同后者聚焦于针对特定任务的伦理修剪模型(如ChatGPT)。旨在理解毒性的起源。我们的发现表明,尽管LLMs正被合理指责提供有毒内容,但这种情况大多是由主动寻求此类内容的人类提出或至少挑衅。我们对数百个被商业供应商API判定为有毒的对话进行了手动分析,这也对当前做法提出了质疑——即哪些用户请求被拒绝作答。此外,我们基于多个经验指标推测,人类表现出心理模型的变化,从与机器交互的心态转向与人类交互的心态。

关键词

引用

@article{arxiv.2407.05977,
  title  = {Exploring Human-LLM Conversations: Mental Models and the Originator of Toxicity},
  author = {Johannes Schneider and Arianna Casanova Flores and Anne-Catherine Kranz},
  journal= {arXiv preprint arXiv:2407.05977},
  year   = {2024}
}