用于医疗隐私数据处理的检索增强思维过程
计算与语言
2024-08-09 v2 人工智能
信息检索
机器学习
摘要
大型语言模型 (LLMs) 已展现出凭借其广泛的医学知识协助临床医生和公众的巨大潜力。然而,由于对训练数据隐私的担忧,其在医疗保健中的应用受到限制,这出于安全和伦理问题阻止了私密和个人信息的整合。此外,如果能够通过信息检索增强其能力以获取最新知识,目前 LLM 与信息检索的整合缺乏对不完美检索的鲁棒性,这会阻碍其有效性甚至降低整体性能。在本工作中,我们通过引入检索增强思维过程 (Retrieval-Augmented Thought Process, RATP) 来应对这一挑战。在访问外部知识的情况下,RATP 将 LLM 的思维生成 formulate 为一个多步决策过程。为了优化这种思维过程,RATP 利用蒙特卡洛树搜索 (Monte-Carlo Tree Search) 并学习一个代理奖励函数,以实现成本效益高的推理。在一个故意排除在任何 LLM 训练集之外的电子病历私有数据集上,RATP 在问答任务中相比上下文检索增强生成 (in-context retrieval-augmented generation) 实现了 35% 的额外准确率。
引用
@article{arxiv.2402.07812,
title = {Retrieval Augmented Thought Process for Private Data Handling in Healthcare},
author = {Thomas Pouplin and Hao Sun and Samuel Holt and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2402.07812},
year = {2024}
}
备注
17 pages, 18 figures