运动-语言模型的时间 grounding 的年鉴式准确检索
计算机视觉与模式识别
2024-07-23 v1
摘要
随着大规模带文本注释的运动数据集的发布,建立健壮的语言和 3D 人体运动潜在空间的任务最近迎来了浓厚的兴趣。已提出 various 方法将人体运动和文本转换为特征,以实现它们之间的准确对应。尽管已通过各种努力来对齐语言和运动表示,但我们认为,尤其是对于复合动作,往往忽视了时间元素,导致 chronologically inaccurate。为阐明运动-语言潜在空间中的时间对齐,我们提出了 Chronologically Accurate Retrieval (CAR) 来评估模型的 chronology understanding。我们将文本描述分解为事件,并通过随机置换复合动作描述中事件的顺序来准备负文本样本。我们随后设计了一个简单任务,要求运动-语言模型从 ground truth 及其 chronologically 被置换的版本中检索更可能的文本。CAR 揭示了许多当前运动-语言模型在理解人体运动事件 chronology 的情况下未能区分 despite their 在常规评估指标方面表现出色。为了实现 text 和 motion 之间的更好的时间对齐,我们进一步提出使用这些被置换事件顺序的文本作为训练期间的负样本,以强化运动-语言模型。我们在 text-motion 检索和 text-to-motion 生成中使用强化后的运动-语言模型进行实验,这些实验表明性能优于常规方法,表明在运动-语言对齐中必须考虑时间元素。
关键词
引用
@article{arxiv.2407.15408,
title = {Chronologically Accurate Retrieval for Temporal Grounding of Motion-Language Models},
author = {Kent Fujiwara and Mikihiro Tanaka and Qing Yu},
journal= {arXiv preprint arXiv:2407.15408},
year = {2024}
}
备注
To appear at ECCV 2024. Project page: https://kfworks.com/CAR-WP/