拼凑线索:评估大语言模型侦探技能的基准
计算与语言
2024-03-21 v3
摘要
侦探在各类案件决策时,尤其面对海量信息时,常同时进行信息侦测与推理。随着大语言模型(LLMs)的快速发展,评估这些模型如何识别关键信息并推理以解决问题变得日益重要。我们提出DetectBench,一个阅读理解数据集,用于评估模型在面对复杂且隐含信息时的关键信息侦测与多跳推理的联合能力。DetectBench包含3,928个问题,每个问题配有一段平均长度为190个token的段落。为提升模型的侦探技能,我们提出侦探思维框架(Detective Thinking Framework)。这些方法鼓励模型在推理前识别上下文中所有可能的线索。我们的实验显示,现有模型在信息侦测与多跳推理上表现不佳。然而,侦探思维框架方法缓解了这一问题。
引用
@article{arxiv.2307.05113,
title = {Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models},
author = {Zhouhong Gu and Lin Zhang and Jiangjie Chen and Haoning Ye and Xiaoxuan Zhu and Zihan Li and Zheyu Ye and Yan Gao and Yao Hu and Yanghua Xiao and Hongwei Feng},
journal= {arXiv preprint arXiv:2307.05113},
year = {2024}
}