中文

利用外部文本数据源的分层动作描述生成

机器学习 2025-09-03 v1

摘要

本文介绍了一种增强现有动作描述生成方法的新方法,该方法将运动表示直接映射到高级描述性描述(例如,“一个人在做开合跳”)。现有方法需要用高级描述(例如,“开合跳”)标注的运动数据。然而,这种数据在现有的运动-文本数据集中很少见,这些数据集还不包含低级运动描述。为了解决这个问题,我们提出了一种两步分层方法。首先,我们利用大型语言模型为运动-文本数据集中出现的每个高级描述创建详细的描述(例如,对于“开合跳”,创建“在双腿开合的同时同步伸展双臂进行跳跃”)。这些精炼的标注用于重新训练运动到文本模型,以生成带有低级细节的描述。其次,我们引入了一种开创性的基于检索的机制。它将详细的低级描述与来自额外文本数据源的候选高级描述对齐,并将它们与运动特征相结合以生成精确的高级描述。我们的方法独特之处在于能够利用来自外部文本源的知识来大幅提高动作描述生成的准确性,特别是对于现有运动-文本数据集中未涵盖的运动。在三个不同的运动-文本数据集(HumanML3D、KIT和BOTH57M)上的实验表明,与最先进的M2T-Interpretable相比,我们的方法在平均性能(涵盖BLEU-1、BLEU-4、CIDEr和ROUGE-L)上实现了6%到50%的提升。

关键词

引用

@article{arxiv.2509.01471,
  title  = {Hierarchical Motion Captioning Utilizing External Text Data Source},
  author = {Clayton Leite and Yu Xiao},
  journal= {arXiv preprint arXiv:2509.01471},
  year   = {2025}
}