Text2Cohort:以自然语言队列发现促进对生物医学数据的直观访问
机器学习
2023-11-28 v3 计算与语言
人机交互
信息检索
摘要
影像数据公共库(IDC)是一个基于云的数据库,为研究人员提供对癌症影像数据的开放访问,旨在促进协作。然而,在 IDC 数据库中进行队列发现存在显著的技术学习曲线。近期,大语言模型(LLM)已展现出在自然语言处理任务上的卓越效用。我们开发了 Text2Cohort,一个由 LLM 驱动的工具包,用于在 IDC 中实现用户友好的自然语言队列发现。我们的方法利用接地技术将用户输入转换为 IDC 查询,并返回查询的响应。我们在 50 条自然语言输入上评估 Text2Cohort,涵盖从信息抽取到队列发现的任务。我们的工具包成功生成响应,准确率达 88%,F1 分数为 0.94。我们证明 Text2Cohort 能够使研究人员以更直观、更用户友好的方式,使用自然语言在 IDC 上以较高级别的准确率发现和筛选队列。
引用
@article{arxiv.2305.07637,
title = {Text2Cohort: Facilitating Intuitive Access to Biomedical Data with Natural Language Cohort Discovery},
author = {Pranav Kulkarni and Adway Kanhere and Paul H. Yi and Vishwa S. Parekh},
journal= {arXiv preprint arXiv:2305.07637},
year = {2023}
}
备注
5 pages, 3 figures, 2 tables