精准且高效:本地检索增强生成模型在医疗任务中超越商业大语言模型
人工智能
2025-06-26 v1 计算与语言
摘要
背景:人工智能(AI)在医疗领域的日益普及,引发对其环境和伦理影响的日益关注。商业大语言模型(如ChatGPT、DeepSeek)需要大量资源,而将其用于医疗目的则引发关于患者隐私和安全的严重问题。方法:我们开发了一个可定制的检索增强生成(RAG)框架,用于医疗任务,监控其能源使用和CO2排放。该系统随后用于创建基于各种开源LLM的RAG。所测试的模型包括通用模型如llama3.1:8b和医学领域特定模型medgemma-4b-it。比较了最佳RAG的性能和能耗与DeepSeekV3-R1和OpenAI的o4-mini模型。使用了医学问题数据集进行评估。结果:定制RAG模型在准确率和能耗方面均优于商业模型。基于llama3.1:8B的RAG实现了最高准确率(58.5%),优于其他模型包括o4-mini和DeepSeekV3-R1。llama3.1-RAG还在能耗和CO2足迹方面表现最佳,单位功耗效率为0.52,总CO2排放为473克。相较于o4-mini,llama3.1-RAG实现了每单位功耗的准确率提升2.7倍,电力消耗降低172%,同时保持更高的准确率。结论:本研究表明,可本地化的LLM可用于开发在医疗任务中超越商业在线LLM的RAG,同时具有更小的环境影响。我们的模块化框架促进了可持续AI发展,减少电力消耗,与联合国可持续发展目标保持一致。
引用
@article{arxiv.2506.20009,
title = {Accurate and Energy Efficient: Local Retrieval-Augmented Generation Models Outperform Commercial Large Language Models in Medical Tasks},
author = {Konstantinos Vrettos and Michail E. Klontzas},
journal= {arXiv preprint arXiv:2506.20009},
year = {2025}
}
备注
18 pages, 3 Figures