MIRAGE:探索大型语言模型在复杂社会交互环境中的表现
计算与语言
2026-01-21 v3
摘要
大型语言模型 (LLM) 在环境感知、基于推理的决策以及模拟复杂人类行为方面展现出了卓越的能力,特别是在交互式角色扮演场景中。本文介绍了多元交互角色扮演能力通用评估 (MIRAGE),这是一个综合框架,旨在通过剧本杀游戏评估 LLM 表现高级人类行为的能力。MIRAGE 包含八个精心设计的剧本,涵盖多样的主题和风格,提供了丰富的模拟。为了评估 LLM 的表现,MIRAGE 采用了四种不同的方法:用于衡量信任与怀疑动态的信任倾向指数 (TII)、用于衡量 LLM 信息处理能力的线索调查能力 (CIC)、用于评估角色扮演能力的交互能力指数 (ICI),以及用于评估 LLM 理解和遵循指令能力的剧本依从性指数 (SCI)。我们的实验表明,即使是像 GPT-4 这样流行的模型,在应对 MIRAGE 呈现的复杂性时也面临重大挑战。数据集和模拟代码可在 \href{https://github.com/lime728/MIRAGE}{github} 获取。
引用
@article{arxiv.2501.01652,
title = {MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments},
author = {Yin Cai and Zhouhong Gu and Zhaohan Du and Zheyu Ye and Shaosheng Cao and Yiqian Xu and Hongwei Feng and Ping Chen},
journal= {arXiv preprint arXiv:2501.01652},
year = {2026}
}