MediQ:提问式大语言模型与可靠交互式临床推理基准
计算与语言
2024-11-08 v3 人工智能
摘要
用户通常以交互方式使用大语言模型,但现有大多数基准测试以静态、单轮格式评估它们,这在交互场景中引发了可靠性问题。我们识别出实现可靠性的一个关键障碍:大语言模型被训练成回答任何问题,即使是在上下文不完整或知识不足的情况下。在本文中,我们提出将静态范式转变为交互范式,开发能够主动提问以收集更多信息并可靠响应的系统,并引入一个基准——MediQ——来评估大语言模型的提问能力。MediQ 模拟了由患者系统和自适应专家系统组成的临床交互;在初始信息可能不完整的情况下,专家在不确定时避免做出诊断决策,而是通过后续问题引出缺失的细节。我们提供了一个将单轮医学基准转换为交互格式的流程。我们的结果表明,直接提示最先进的大语言模型去提问会降低性能,这表明将大语言模型适应于主动信息寻求场景并非易事。我们尝试了弃权策略以更好地估计模型置信度并决定何时提问,将诊断准确率提高了 22.3%;然而,与(实践中不现实的)预先拥有完整信息的上限相比,性能仍然落后。进一步的分析表明,过滤不相关上下文和重新格式化对话可以改善交互性能。总的来说,我们引入了一个关于大语言模型可靠性的新问题、一个交互式 MediQ 基准和一个新颖的提问系统,并指出了在关键领域扩展大语言模型信息寻求能力的方向。
引用
@article{arxiv.2406.00922,
title = {MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning},
author = {Shuyue Stella Li and Vidhisha Balachandran and Shangbin Feng and Jonathan S. Ilgen and Emma Pierson and Pang Wei Koh and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2406.00922},
year = {2024}
}
备注
29 pages, 12 figures