中文

使用预训练视觉-语言模型和黑箱优化的烹饪机器人连续物体状态识别

机器人学 2024-03-19 v1 计算机视觉与模式识别 机器学习

摘要

机器人对环境和物体的状态识别通常基于将当前状态判断为一个分类问题。另一方面,烹饪中食物的状态变化是连续发生的,不仅需要在特定时间点捕捉,还需要随时间连续捕捉。此外,食物的状态变化复杂,难以通过手动编程轻松描述。因此,我们提出一种方法,通过口语使用预训练的大规模视觉-语言模型来识别烹饪机器人所处理食物的连续状态变化。通过使用能够随时间连续计算图像与文本之间相似度的模型,我们可以在烹饪过程中捕捉食物的状态变化。我们还表明,通过基于将相似度变化拟合到 S 型函数来调整每个文本提示的权重,然后进行黑箱优化,可以实现更准确、更鲁棒的连续状态识别。我们通过对烧水、黄油融化、鸡蛋烹饪和洋葱翻炒进行识别,展示了该方法的有效性和局限性。

关键词

引用

@article{arxiv.2403.08239,
  title  = {Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization},
  author = {Kento Kawaharazuka and Naoaki Kanazawa and Yoshiki Obinata and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2403.08239},
  year   = {2024}
}

备注

accepted at IEEE Robotics and Automation Letters (RA-L), website - https://haraduka.github.io/continuous-state-recognition/