中文

随机有多随机?评估大语言模型抛硬币的随机性与人性

人工智能 2024-06-04 v1 机器学习

摘要

人类一个独特的特质是我们无法做到随机。我们在本不应存在模式的地方看到并产生模式,而且是以可预测的方式。大语言模型(LLM)使用人类数据训练,容易受到人类偏见的影响。在这项工作中,我们通过生成二元随机序列这一研究充分的现象,探讨LLM如何处理随机性以及它们在何处、如何失败。我们发现GPT-4和Llama 3几乎表现出并加剧了我们在此背景下测试的每一种人类偏见,但GPT-3.5表现出更随机的行为。这种随机性与人性的二分法被提出作为LLM的一个基本问题,并且每种行为在不同情况下可能都有用。

关键词

引用

@article{arxiv.2406.00092,
  title  = {How Random is Random? Evaluating the Randomness and Humaness of LLMs' Coin Flips},
  author = {Katherine Van Koevering and Jon Kleinberg},
  journal= {arXiv preprint arXiv:2406.00092},
  year   = {2024}
}