中文

视频生成在增强数据受限动作理解中的作用

计算机视觉与模式识别 2025-10-13 v2

摘要

真实世界场景中的视频动作理解任务始终面临数据受限问题。本文通过弥合数据稀缺性来解决数据受限的动作理解问题。我们提出了一种新方法,采用文本到视频扩散 Transformer 为模型训练生成带标注数据。该范式能够在无限规模上生成逼真的带标注数据,且无需人工干预。我们提出了针对生成样本训练的信息增强策略和基于不确定性的标签平滑策略。通过定量和定性分析,我们观察到真实样本通常比生成样本包含更丰富的信息。基于这一观察,我们提出了信息增强策略,从环境和角色两个方面增强生成样本的信息内容。此外,我们观察到部分低质量的生成样本可能对模型训练产生负面影响。为解决此问题,我们设计了基于不确定性的标签平滑策略,以增加这些样本的平滑度,从而降低其影响。我们在四个数据集上的五项任务中证明了所提方法的有效性,并在零样本动作识别中取得了 SOTA 性能。

关键词

引用

@article{arxiv.2505.19495,
  title  = {The Role of Video Generation in Enhancing Data-Limited Action Understanding},
  author = {Wei Li and Dezhao Luo and Dongbao Yang and Zhenhang Li and Weiping Wang and Yu Zhou},
  journal= {arXiv preprint arXiv:2505.19495},
  year   = {2025}
}

备注

IJCAI2025