大语言模型在信息不完整场景下是否具备问题解决能力?
计算与语言
2024-09-24 v1 人工智能
摘要
评估大语言模型(LLM)在信息不完整场景下的问题解决能力日益重要,其能力涵盖提问、知识搜索、错误检测和路径规划等方面。当前研究主要关注LLM在诸如“二十个问题”等游戏中的问题解决能力。然而,这类游戏不需要识别误导性线索,而这些线索在信息不完整场景中是必要的。此外,现有的诸如“谁是卧底”等游戏主观性很强,难以评估。因此,在本文中,我们基于“谁是卧底”和“二十个问题”引入了一个名为BrainKing的新游戏,用于评估LLM在信息不完整场景下的能力。它要求LLM通过有限的“是/否”问题和潜在的误导性答案来识别目标实体。通过设置简单、中等和困难三种难度模式,我们全面评估了LLM在不同方面的表现。我们的结果揭示了LLM在BrainKing中的能力和局限性,为LLM问题解决水平提供了重要见解。
引用
@article{arxiv.2409.14762,
title = {Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?},
author = {Yuyan Chen and Tianhao Yu and Yueze Li and Songzhou Yan and Sijia Liu and Jiaqing Liang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2409.14762},
year = {2024}
}
备注
Accepted to ACL 2024 (Findings)