VIoTGPT:在 LLM 中学习调度视觉工具以迈向智能视频物联网
计算机视觉与模式识别
2024-12-24 v2 多媒体
摘要
视频物联网(VIoT)在收集空前规模的视频数据方面已展现出充分潜力。如何统一、高效且尤其是智能地调度领域特定的感知模型并分析所收集的视频以完成复杂任务,是一个挑战。为应对该挑战,我们构建了 VIoTGPT,这是一个基于 LLM 的框架,用于正确地与人类交互、查询知识视频并调用视觉模型协作分析多媒体数据。为支持 VIoTGPT 及相关的未来工作,我们精心制作了 VIoT-Tool 数据集,包括基于半自动标注、涵盖三类共 11 个代表性视觉模型的训练数据集与基准。为引导 LLM 充当面向智能 VIoT 的智能体,我们采用基于 VIoT-Tool 的 ReAct 指令微调方法来学习工具能力。定量与定性实验及分析证明了 VIoTGPT 的有效性。我们相信 VIoTGPT 有助于改善 VIoT 应用中以人为中心的体验。项目网站为 https://github.com/zhongyy/VIoTGPT。
引用
@article{arxiv.2312.00401,
title = {VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things},
author = {Yaoyao Zhong and Mengshi Qi and Rui Wang and Yuhan Qiu and Yang Zhang and Huadong Ma},
journal= {arXiv preprint arXiv:2312.00401},
year = {2024}
}
备注
AAAI 2025, 12 pages