中文

GuessArena: 猜猜我是谁?一个用于评估 LLM 领域特定知识与推理的自适应框架

计算与语言 2025-05-29 v1

摘要

大型语言模型 (LLMs) 的评估传统上依赖于静态基准,这种范式存在两大局限性:(1) 预定义的测试集缺乏对多样化应用领域的适应性;(2) 标准化的评估协议往往无法捕捉对领域特定知识和上下文推理能力的细粒度评估。为了克服这些挑战,我们提出 GuessArena,一个基于对抗博弈交互的自适应评估框架。受“猜猜我是谁?”游戏交互结构的启发,我们的框架将动态领域知识建模与渐进式推理评估无缝集成,以提高评估保真度。在金融、医疗、制造、信息技术和教育五个垂直领域的实证研究表明,GuessArena 能有效区分 LLMs 在领域知识覆盖率和推理链完整性方面的表现。与传统基准相比,我们的方法在可解释性、可扩展性和场景适应性方面具有显著优势。

关键词

引用

@article{arxiv.2505.22661,
  title  = {GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning},
  author = {Qingchen Yu and Zifan Zheng and Ding Chen and Simin Niu and Bo Tang and Feiyu Xiong and Zhiyu Li},
  journal= {arXiv preprint arXiv:2505.22661},
  year   = {2025}
}

备注

Accepted by ACL 2025