GPT超声图谱:通过视觉语言模型从前臂超声图像解码手势
计算机视觉与模式识别
2024-07-16 v1 人工智能
人机交互
机器学习
摘要
大型视觉语言模型(LVLMs),如生成式预训练变换器4-omni(GPT-4o),正在成为具有广泛潜力的多模态基础模型,作为强大的人工智能辅助工具可应用于众多领域,包括医疗、工业和学术领域。尽管这些基础模型在广泛的通用任务上表现良好,但在没有微调的情况下的专用任务能力往往有限。然而,对大型基础模型进行完全微调因计算/内存/数据集要求而具有挑战。我们展示了GPT-4o能够在无需微调的情况下解码来自前臂超声数据的手势,并且通过少量样本的原语学习(few-shot in-context learning)进行改进。
引用
@article{arxiv.2407.10870,
title = {GPT Sonograpy: Hand Gesture Decoding from Forearm Ultrasound Images via VLM},
author = {Keshav Bimbraw and Ye Wang and Jing Liu and Toshiaki Koike-Akino},
journal= {arXiv preprint arXiv:2407.10870},
year = {2024}
}
备注
8 pages, 9 figures