中文

基于Reddit数据的低资源医学问答双层检索增强生成框架:概念验证研究

计算与语言 2025-01-08 v2 人工智能

摘要

社交媒体越来越多地被用于分享物质使用的亲身经历,这为获取关于副作用、使用模式和对新型精神活性物质的看法提供了独特机会。然而,由于数据量庞大,通过自然语言处理技术(如大语言模型)获取有用见解具有挑战性。本文旨在开发一种检索增强生成(RAG)架构,用于回答临床医生关于健康相关主题新兴问题的医学问答,利用社交媒体上的用户生成医学信息。我们提出了一个双层RAG框架,用于面向查询的答案生成,并在社交媒体论坛上针对查询焦点摘要生成的背景下评估了该框架的概念验证,重点关注新兴药物相关信息。我们的模块化框架生成单个摘要,然后汇总摘要,以高效地从大量用户生成的社交媒体数据中回答医学查询。我们比较了可在低资源环境中部署的量化大语言模型(Nous-Hermes-2-7B-DPO)与GPT-4的性能。在这项概念验证研究中,我们使用来自Reddit的用户生成数据来回答临床医生关于使用氯胺酮和氯胺酮的问题。我们的框架在使用GPT-4和Nous-Hermes-2-7B-DPO评估时,在相关性、长度、幻觉、覆盖率和连贯性方面取得了可比的中位数分数,评估了20个查询共76个样本。两者在覆盖率、连贯性、相关性、长度和幻觉方面没有统计学显著差异。在Coleman-Liau指数上观察到统计学显著差异。我们的RAG框架可以有效回答关于特定主题的医学问题,并且可以在资源受限的环境中部署。

关键词

引用

@article{arxiv.2405.19519,
  title  = {Two-Layer Retrieval-Augmented Generation Framework for Low-Resource Medical Question Answering Using Reddit Data: Proof-of-Concept Study},
  author = {Sudeshna Das and Yao Ge and Yuting Guo and Swati Rajwal and JaMor Hairston and Jeanne Powell and Drew Walker and Snigdha Peddireddy and Sahithi Lakamana and Selen Bozkurt and Matthew Reyna and Reza Sameni and Yunyu Xiao and Sangmi Kim and Rasheeta Chandler and Natalie Hernandez and Danielle Mowery and Rachel Wightman and Jennifer Love and Anthony Spadaro and Jeanmarie Perrone and Abeed Sarker},
  journal= {arXiv preprint arXiv:2405.19519},
  year   = {2025}
}

备注

Published in JMIR: https://www.jmir.org/2025/1/e66220