Motion2Language:同步语义动作分割的无监督学习
计算机视觉与模式识别
2023-12-14 v2 计算与语言
摘要
在本文中,我们研究构建一种序列到序列架构,用于动作到语言的翻译与同步。目标是将动作捕捉输入翻译为英文自然语言描述,使得描述与所执行动作同步生成,从而将语义分割作为副产品实现,但无需同步训练数据。我们提出了一种适用于同步/实时文本生成的局部注意力循环公式,以及一种更适用于较小数据和同步生成的改进动作编码器架构。我们在独立实验中分别评估这两项贡献,使用标准 BLEU4 指标以及简单的语义等价度量,在 KIT 动作语言数据集上进行。在后续实验中,我们通过多种评估指标评估所提方法中生成文本同步的质量。我们发现,对注意力机制和编码器架构的两项贡献可叠加地改善生成文本的质量(BLEU 和语义等价),同时也改善同步性。我们的代码可在 https://github.com/rd20karim/M2T-Segmentation/tree/main 获取。
引用
@article{arxiv.2310.10594,
title = {Motion2Language, unsupervised learning of synchronized semantic motion segmentation},
author = {Karim Radouane and Andon Tchechmedjiev and Julien Lagarde and Sylvie Ranwez},
journal= {arXiv preprint arXiv:2310.10594},
year = {2023}
}
备注
Published at Neural Computing and Applications