中文

将波斯语说唱集成至 Surena-V 人形机器人以实现人机交互

计算机视觉与模式识别 2025-01-27 v1 机器人学

摘要

说唱技术对社交场景中的机器人至关重要,有助于提升其理解人类沟通方式的能力。这种技能使机器人在拥挤环境中更容易进行交流,尤其在照护和客户服务等角色中尤为重要。本研究生成了波斯语说唱数据集,将波斯语说唱技术集成到 Surena-V 人形机器人中,以提升其语音识别能力。探索了两种互补方法:一种是基于面部关键点跟踪的间接方法,另一种是利用卷积神经网络(CNN)和长短期记忆网络(LSTM)的直接方法。间接方法聚焦于跟踪围绕嘴部的关键面部特征点以推断运动,而直接方法则处理原始视频数据进行动作和语音识别。效果最佳的模型为 LSTM,达到了89%的准确率,并已成功集成至 Surena-V 机器人中,用于实时人机交互。该研究突显了这些方法的有效性,尤其是在语言交流受限的环境中。

关键词

引用

@article{arxiv.2501.13996,
  title  = {Integrating Persian Lip Reading in Surena-V Humanoid Robot for Human-Robot Interaction},
  author = {Ali Farshian Abbasi and Aghil Yousefi-Koma and Soheil Dehghani Firouzabadi and Parisa Rashidi and Alireza Naeini},
  journal= {arXiv preprint arXiv:2501.13996},
  year   = {2025}
}