中文

基于提示引导的多模态交互叙事动作评估

计算机视觉与模式识别 2024-04-29 v2

摘要

本文探讨了一种新问题——叙事动作评估(NAE)。NAE旨在生成对动作执行情况进行专业评论的叙述性语言。与传统任务(如基于分数的动作质量评估和视频描述)涉及表面化语句不同,NAE致力于创建详细的自然语言叙述,这些叙述提供动作细节描述并伴随客观评估。由于需要叙事的灵活性和评估的严谨性,NAE是一个更具挑战性的任务。现有方法之一是使用多任务学习,其中叙述语言和评估信息分别预测,但这种方法由于任务之间的差异以及语言信息与评估信息之间模态差异,导致单个任务性能下降。为此,我们提出了一种提示引导的多模态交互框架。该框架利用一对变换器来促进不同信息模态之间的交互,还利用提示将评分回归任务转化为视频-文本匹配任务,从而实现任务间的交互性。为支持该领域进一步的研究,我们对MTL-AQA和FineGym数据集进行了重新标注,提供高质量和全面的动作叙述。此外,我们为NAE建立了基准测试。大量实验结果证明,我们的方法优于单独学习方法和朴素的多任务学习方法。数据和代码已发布于https://github.com/shiyi-zh0408/NAE_CVPR2024。

关键词

引用

@article{arxiv.2404.14471,
  title  = {Narrative Action Evaluation with Prompt-Guided Multimodal Interaction},
  author = {Shiyi Zhang and Sule Bai and Guangyi Chen and Lei Chen and Jiwen Lu and Junle Wang and Yansong Tang},
  journal= {arXiv preprint arXiv:2404.14471},
  year   = {2024}
}

备注

Accepted by CVPR 2024