基于 K-Means 利用视觉与听觉线索的场景识别
机器人学
2018-11-28 v1
摘要
我们提出了一种基于 K-Means 的预测系统,昵称为 SERVANT(通过视觉与听觉线索进行场景识别),能够通过分析环境声音与颜色线索来识别环境场景。该概念与实现起源于斯坦福人工智能实验室-丰田中心(SAIL-TC)智能可穿戴机器人项目(亦称第三只手臂项目)中的学习分支。第三只手臂项目致力于开发并构想一种能够在多种情境中辅助用户的机械臂,例如端一杯咖啡、举着手电筒。Servant 采用 K-Means 拟合-预测架构,利用视觉与听觉线索对环境场景(如咖啡店或篮球馆)进行分类。在此分类之后,Servant 可基于先前的训练推荐情境化动作。
引用
@article{arxiv.1811.11004,
title = {Scene Recognition Through Visual and Acoustic Cues Using K-Means},
author = {Sidharth Rajaram and J. Kenneth Salisbury},
journal= {arXiv preprint arXiv:1811.11004},
year = {2018}
}
备注
4 pages, 7 figures, work done under Intelligent Wearable Robotics Project at Stanford Artificial Intelligence Lab