通过输入驱动的显著性自适应实现端侧医疗 AI 助手
计算与语言
2025-08-08 v3 人工智能
硬件体系结构
系统与控制
系统与控制
摘要
大语言模型(LLM)对医疗场景产生了重大影响,但对于部署在边缘设备等实时、资源受限的环境中而言,其规模仍然过大。在本工作中,我们引入了一个新颖的医疗助手系统,通过我们的通用压缩框架进行了优化,该框架将大语言模型(LLM)定制化以部署于专业领域。通过在特定领域数据上测量神经元显著性,我们的方法可以激进地剪枝不相关的神经元,在保持性能的同时减小模型大小。剪枝之后,我们应用训练后量化以进一步减少内存占用,并在包括 MedMCQA、MedQA 和 PubMedQA 在内的医疗基准上评估压缩后的模型。我们还将 50% 压缩的 Gemma 和 67% 压缩的 LLaMA3 模型部署在 Jetson Orin Nano(峰值 18.7W)和 Raspberry Pi 5(峰值 6.3W)上,在硬件限制下实现了实时、节能的推理。
引用
@article{arxiv.2506.11105,
title = {Enabling On-Device Medical AI Assistants via Input-Driven Saliency Adaptation},
author = {Uttej Kallakurik and Edward Humes and Rithvik Jonna and Xiaomin Lin and Tinoosh Mohsenin},
journal= {arXiv preprint arXiv:2506.11105},
year = {2025}
}
备注
Accepted for publication in the Proceedings of IEEE BioCAS 2025