CLIPSwarm:基于视觉语言模型的文本提示生成无人机表演
机器人学
2024-03-21 v1 计算机视觉与模式识别
摘要
本文介绍 CLIPSwarm,一种新算法用于自动化无人机编队 formations 的建模。该算法从丰富给定单词,构建用于输入到迭代方法的文本提示,以找到最符合该单词的 formation。算法通过迭代细化机器人 formations 以与文本描述对齐,分别采用不同的步骤进行“探索”和“开发”。我们的框架目前在简单 formation 目标上进行评估,仅限于轮廓形状。formation 通过 alpha-shape 轮廓进行可视化表示,并自动找到最具代表性的颜色以匹配输入单词。为衡量描述与 formation 视觉表示之间的相似性,我们使用 CLIP [1] 对文本和图像编码为向量并评估其相似度。随后,算法在给定无人机约束条件下重新排列 formation,以更有效地视觉化化单词。随后分配控制动作给无人机,确保机器人行为和碰撞自由运动。实验结果表明,该系统在准确建模来自自然语言描述的机器人 formations 方面具有有效性。该算法的灵活性通过在不同形状下执行无人机表演的照片逼真仿真得以展示。我们建议读者参考补充视频以获取结果的视觉参考。
关键词
引用
@article{arxiv.2403.13467,
title = {CLIPSwarm: Generating Drone Shows from Text Prompts with Vision-Language Models},
author = {Pablo Pueyo and Eduardo Montijano and Ana C. Murillo and Mac Schwager},
journal= {arXiv preprint arXiv:2403.13467},
year = {2024}
}