探索人类-LLM对话:心理模型与毒性的起源
人机交互
2024-07-09 v1 人工智能
摘要
本研究探讨了大型语言模型(LLMs)在多样化、无约束环境中的真实世界人类交互,与大多数前期研究不同后者聚焦于针对特定任务的伦理修剪模型(如ChatGPT)。旨在理解毒性的起源。我们的发现表明,尽管LLMs正被合理指责提供有毒内容,但这种情况大多是由主动寻求此类内容的人类提出或至少挑衅。我们对数百个被商业供应商API判定为有毒的对话进行了手动分析,这也对当前做法提出了质疑——即哪些用户请求被拒绝作答。此外,我们基于多个经验指标推测,人类表现出心理模型的变化,从与机器交互的心态转向与人类交互的心态。
引用
@article{arxiv.2407.05977,
title = {Exploring Human-LLM Conversations: Mental Models and the Originator of Toxicity},
author = {Johannes Schneider and Arianna Casanova Flores and Anne-Catherine Kranz},
journal= {arXiv preprint arXiv:2407.05977},
year = {2024}
}