中文

GPT超声图谱:通过视觉语言模型从前臂超声图像解码手势

计算机视觉与模式识别 2024-07-16 v1 人工智能 人机交互 机器学习

摘要

大型视觉语言模型(LVLMs),如生成式预训练变换器4-omni(GPT-4o),正在成为具有广泛潜力的多模态基础模型,作为强大的人工智能辅助工具可应用于众多领域,包括医疗、工业和学术领域。尽管这些基础模型在广泛的通用任务上表现良好,但在没有微调的情况下的专用任务能力往往有限。然而,对大型基础模型进行完全微调因计算/内存/数据集要求而具有挑战。我们展示了GPT-4o能够在无需微调的情况下解码来自前臂超声数据的手势,并且通过少量样本的原语学习(few-shot in-context learning)进行改进。

关键词

引用

@article{arxiv.2407.10870,
  title  = {GPT Sonograpy: Hand Gesture Decoding from Forearm Ultrasound Images via VLM},
  author = {Keshav Bimbraw and Ye Wang and Jing Liu and Toshiaki Koike-Akino},
  journal= {arXiv preprint arXiv:2407.10870},
  year   = {2024}
}

备注

8 pages, 9 figures