面向场景理解的边缘摄像机控制:语言模型方法
机器人学
2025-08-08 v1 人工智能
人机交互
摘要
本文提出优化提示统一系统(OPUS),一种利用大语言模型(LLM)控制盘旋式云台镜头(PTZ)的框架,为自然环境提供情境感知能力。为实现此目标,OPUS系统通过生成高级摄像机控制API的关键词,将知识从大型闭源语言模型迁移到更小的模型上,并基于监督微调(SFT)在合成数据上进行训练,从而提高成本效益,同时保持与GPT-4等大型模型相当的性能。OPUS通过将来自多个摄像机的数据转换为文本描述来增强环境意识,无需专门的感知标记。在基准测试中,我们的方法在传统语言模型技术和更复杂的提示方法上均显著优于后者,相较于先进技术提升35%,相较于闭源模型如Gemini Pro提升20%的任务准确率。该系统展示了OPUS的能力,通过直观的自然语言界面简化了PTZ摄像机的操作。该方法无需显式编程,提供了与摄像系统交互的对话式方法,代表了用户控制和利用PTZ摄像机技术的重大进步。
引用
@article{arxiv.2505.06402,
title = {Camera Control at the Edge with Language Models for Scene Understanding},
author = {Alexiy Buynitsky and Sina Ehsani and Bhanu Pallakonda and Pragyana Mishra},
journal= {arXiv preprint arXiv:2505.06402},
year = {2025}
}
备注
7 pages, 6 figures. This work was presented and published at the 11th IEEE International Conference on Control, Automation and Robotics (ICCAR) in 2025