中文

用于基础模型在机器人子任务事后分析中的时序与语义评估指标

机器人学 2025-04-02 v2 机器学习

摘要

近期在任务与运动规划(TAMP)领域的研究表明,利用带有高质量标签的语言监督机器人轨迹训练控制策略,能显著提高智能体的任务成功率。然而,此类数据的稀缺性是将这些方法推广到通用用例的重大障碍。为解决这一问题,我们提出一个自动化框架,通过利用近期基础模型(FM)的提示策略,包括大型语言模型(LLM)和视觉语言模型(VLM),将轨迹数据分解为具有时间边界且基于自然语言描述的子任务。我们的框架为构成完整轨迹的低层子任务提供基于时间和基于语言的描述。为严格评估我们自动标注框架的质量,我们贡献了SIMILARITY算法,以产生两个新颖的指标:时序相似度和语义相似度。这些指标衡量两个子任务分解(即基础模型预测的子任务分解与真实子任务分解)之间语言描述的时间对齐程度和语义保真度。在多个机器人环境中,我们展示的时序相似度和语义相似度得分均超过90%,而随机基线的得分仅为30%,这证明了所提框架的有效性。我们的结果有助于构建多样化、大规模、语言监督的数据集,以改进机器人TAMP。

关键词

引用

@article{arxiv.2403.17238,
  title  = {Temporal and Semantic Evaluation Metrics for Foundation Models in Post-Hoc Analysis of Robotic Sub-tasks},
  author = {Jonathan Salfity and Selma Wanna and Minkyu Choi and Mitch Pryor},
  journal= {arXiv preprint arXiv:2403.17238},
  year   = {2025}
}

备注

8 pages, 3 figures. IROS 2024 Submission