中文

边缘医疗:基于移动设备的大语言模型的临床推理比较性能分析

计算与语言 2025-02-14 v1

摘要

在移动设备上部署大型语言模型(LLM)为医疗应用带来了显著潜力,通过消除对基于云端服务的依赖并将敏感健康数据保留在本地,显著提升了隐私性、安全性和成本效益。然而,所需在真实世界医疗情境中评估所需的 LLM 的性能和准确性仍未得到充分探索。本研究使用 AMEGA 数据集对可公开获取的移动设备 LLM 进行基准测试,评估其准确性、计算效率和热限制在各种移动设备上的表现。我们的结果表明,紧凑型通用模型如 Phi-3 Mini 在速度和准确性之间实现了良好平衡,而医学微调模型如 Med42 和 Aloe 则实现最高准确性。值得注意的是,尽管在较旧设备上部署 LLM 仍然可行,但内存约束对实际处理性能的挑战更大。我们的研究强调了移动设备 LLM 在医疗保健中的潜力,同时强调需要更高效的推理和针对真实世界临床推理需求的模型。

关键词

引用

@article{arxiv.2502.08954,
  title  = {Medicine on the Edge: Comparative Performance Analysis of On-Device LLMs for Clinical Reasoning},
  author = {Leon Nissen and Philipp Zagar and Vishnu Ravi and Aydin Zahedivash and Lara Marie Reimer and Stephan Jonas and Oliver Aalami and Paul Schmiedmayer},
  journal= {arXiv preprint arXiv:2502.08954},
  year   = {2025}
}