KRAST:面向视觉语言模型的结构化文本知识增强机器人动作识别
计算机视觉与模式识别
2025-09-23 v1 人工智能
摘要
准确的基于视觉的动作识别对于开发能够在复杂、真实世界环境中安全可靠运行的自主机器人至关重要。在本工作中,我们通过利用富含领域知识的视觉语言模型(VLMs),推进了机器人感知中室内日常动作的基于视频的识别。我们适配了一个提示学习框架,其中每个动作的类级文本描述作为可学习的提示被嵌入到一个冻结的预训练 VLM 主干中。我们设计并评估了多种用于结构化和编码这些文本描述的策略。在 ETRI-Activity3D 数据集上的实验表明,我们的方法在测试时仅使用 RGB 视频输入,实现了超过 95% 的准确率,并优于 SOTA 方法。这些结果突出了知识增强提示在以最少监督实现鲁棒动作识别方面的有效性。
引用
@article{arxiv.2509.16452,
title = {KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models},
author = {Son Hai Nguyen and Diwei Wang and Jinhyeok Jang and Hyewon Seo},
journal= {arXiv preprint arXiv:2509.16452},
year = {2025}
}