中文

一种基于多模态多任务学习的急救医疗智能眼镜系统

机器学习 2025-11-18 v1 音频与语音处理 图像与视频处理

摘要

急救医疗技术员(EMT)在高压环境中工作,需要在沉重的认知和操作负载下进行快速、关乎生命的决策。我们提出EMSGlass,一个由EMSNet驱动的智能眼镜系统,EMSNet是首个为急救医疗服务(EMS)设计的多模态多任务模型,同时我们还开发了针对EMS场景的低延迟多模态服务框架EMSServe。EMSNet整合了文本、生命体征和场景图像,构建对EMS事件的统一实时理解。基于真实世界的多模态EMS数据集训练的EMSNet能够同时支持最多五项关键EMS任务,准确率优于领先的单模态基线方法。基于PyTorch构建的EMSServe引入了一种模态感知模型分割器和特征缓存机制,实现了跨异构硬件的自适应高效推理,解决了现场异步模态到达的挑战。通过优化EMS场景下的多模态推理执行,EMSServe相对于直接的PyTorch多模态推理实现了1.9倍至11.7倍的加速。六名专业EMT的用户研究评估表明,EMSGlass通过直观的眼镜交互方式提升了实时情境意识、决策速度和操作效率。此外,用户研究的定性见解为将EMSGlass扩展至下一代AI驱动的EMS系统提供了可操作的方向,桥接了多模态智能与现实世界紧急响应工作流程。

关键词

引用

@article{arxiv.2511.13078,
  title  = {A Smart-Glasses for Emergency Medical Services via Multimodal Multitask Learning},
  author = {Liuyi Jin and Pasan Gunawardena and Amran Haroon and Runzhi Wang and Sangwoo Lee and Radu Stoleru and Michael Middleton and Zepeng Huo and Jeeeun Kim and Jason Moats},
  journal= {arXiv preprint arXiv:2511.13078},
  year   = {2025}
}