文本到动作生成的最佳自动化度量指标是什么?
计算与语言
2023-09-20 v1 图形学
机器学习
摘要
从自然语言描述生成基于骨架的人体动作正引起越来越多的关注。尽管多数工作集中于为该任务开发更好的神经架构,但在确定恰当评估指标方面尚无显著进展。人工评估是该任务的最终精度度量,自动化指标应与人的质量判断良好相关。由于描述可兼容多种动作,确定正确指标对评估和设计有效生成模型至关重要。本文系统研究哪些指标最能对齐人工评估,并提出对齐更好的新指标。我们的发现表明,当前用于该任务的指标在样本层面上无一与人类判断呈现甚至中等程度的相关性。但在评估平均模型性能时,常用指标如 R-Precision 和较少使用的坐标误差展现出强相关性。此外,若干近期开发的指标因相关性低于替代方案而不被推荐。我们还引入基于类 BERT 多模态模型 MoBERT 的新指标,其提供与人工强相关的样本级评估,同时保持近乎完美的模型级相关性。结果显示该新指标相较所有现有替代方案具有广泛优势。
引用
@article{arxiv.2309.10248,
title = {What is the Best Automated Metric for Text to Motion Generation?},
author = {Jordan Voas and Yili Wang and Qixing Huang and Raymond Mooney},
journal= {arXiv preprint arXiv:2309.10248},
year = {2023}
}
备注
8 pages, SIGGRAPH Asia 2023 Conference