中文

借我之眼:通过视觉提示将多模态大语言模型 grounded 到传感器数据

计算与语言 2024-10-01 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

大语言模型 (LLM) 在各个领域已展现出卓越的能力。然而,由于现有文本提示方法在处理长传感器数据序列时表现显著下降,利用 LLM 进行普适感知应用仍存在挑战。我们提出了一种针对传感器数据的方法,利用多模态大语言模型 (MLLM) 实现视觉提示。我们设计了一种视觉提示,引导 MLLM 同时利用可视化传感器数据和目标感知任务描述。此外,我们引入了一个可视化生成器,自动为给定感知任务创建最佳可视化,无需先验的任务特定知识。我们在涉及四种感知模态的九个感知任务上进行评估,实验结果显示,我们的方法平均比基于文本的提示提高了 10% 的准确率,并将 token 成本降低了 15.8 倍。我们的发现凸显了视觉提示在各种感知任务中对 MLLM 有效性和成本效益的体现。源代码可在 https://github.com/diamond264/ByMyEyes 查看。

关键词

引用

@article{arxiv.2407.10385,
  title  = {By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting},
  author = {Hyungjun Yoon and Biniyam Aschalew Tolera and Taesik Gong and Kimin Lee and Sung-Ju Lee},
  journal= {arXiv preprint arXiv:2407.10385},
  year   = {2024}
}

备注

Accepted to the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024) Main