社交推理游戏中LLM的细粒度与主题评估
人工智能
2025-10-08 v3 计算与语言
摘要
近期研究探讨了大语言模型(LLMs)是否能够支持隐蔽通信,其核心特征包括推断言外之意和规避怀疑。为进行此类研究,研究人员使用社交推理游戏(SDG)作为实验环境,玩家在其中隐藏和推断特定信息。然而,先前工作往往忽视了在此类设置中应如何评估LLMs。具体而言,我们指出了其评估方法的两个局限性。第一,先前研究中使用的指标是粗粒度的,因为它们基于整体游戏结果,往往无法捕捉事件级别的行为;第二,错误分析缺乏能够产生有意义地支撑评估结果洞察的结构化方法。为解决这些局限性,我们提出了一种微观且系统化的研究方法。具体而言,我们引入了六个细粒度指标以解决第一个问题。为解决第二个问题,我们进行了主题分析,识别出四个削弱LLMs在隐蔽通信中表现的主要推理失败。
引用
@article{arxiv.2408.09946,
title = {Fine-Grained and Thematic Evaluation of LLMs in Social Deduction Game},
author = {Byungjun Kim and Dayeon Seo and Minju Kim and Bugeun Kim},
journal= {arXiv preprint arXiv:2408.09946},
year = {2025}
}
备注
Published in IEEE Access