RAmBLA:评估 LLM 作为生物医学领域助手可靠性的框架
机器学习
2024-03-22 v1 人工智能
摘要
大语言模型(LLMs)越来越多地支持广泛领域的应用,其中一些如生物医学具有潜在的高社会影响,然而它们在真实用例中的可靠性研究尚不充分。在这项工作中,我们引入了生物医学 LLM 助手可靠性评估(RAmBLA)框架,并评估了四个最先进的基础 LLM 是否能在生物医学领域充当可靠的助手。我们将提示鲁棒性、高召回率和无幻觉确定为该用例的必要标准。我们设计了简短任务和需要 LLM 自由形式回答的任务,以模拟真实世界的用户交互。我们通过评估器 LLM,利用与真实答案的语义相似度来评估 LLM 的性能。
引用
@article{arxiv.2403.14578,
title = {RAmBLA: A Framework for Evaluating the Reliability of LLMs as Assistants in the Biomedical Domain},
author = {William James Bolton and Rafael Poyiadzi and Edward R. Morrell and Gabriela van Bergen Gonzalez Bueno and Lea Goetz},
journal= {arXiv preprint arXiv:2403.14578},
year = {2024}
}
备注
Published at ICLR 2024 Workshop on Reliable and Responsible Foundation Models