中文

大语言模型距离可信 AI 还有多远?一个评估人类行为模拟可信度的基准

计算与语言 2024-06-18 v2 计算机与社会

摘要

近年来,AI 在模拟人类行为方面展现出卓越能力,尤其是基于大语言模型(LLM)的实现。然而,由于缺乏对 LLM 模拟行为的系统评估,LLM 在人类眼中的可信度仍然模糊,即不清楚哪些 LLM 行为具有令人信服的人类特征,哪些需要进一步改进。在本工作中,我们设计了 SimulateBench 来评估 LLM 模拟人类行为时的可信度。具体而言,我们基于两个关键维度评估 LLM 的可信度:1) 一致性:LLM 的行为与给定待模拟人类信息的一致程度;2) 鲁棒性:LLM 模拟行为在面对扰动时保持鲁棒的能力。SimulateBench 包含 65 个人物画像和总共 8,400 个问题,用于检验 LLM 的模拟行为。基于 SimulateBench,我们评估了 10 种广泛使用的 LLM 在模拟人物时的表现。实验结果表明,当前的 LLM 难以使其行为与指定角色保持一致,并且在某些因素的扰动下显得脆弱。

关键词

引用

@article{arxiv.2312.17115,
  title  = {How Far Are LLMs from Believable AI? A Benchmark for Evaluating the Believability of Human Behavior Simulation},
  author = {Yang Xiao and Yi Cheng and Jinlan Fu and Jiashuo Wang and Wenjie Li and Pengfei Liu},
  journal= {arXiv preprint arXiv:2312.17115},
  year   = {2024}
}