基于自动生成的分形数据集的动作识别预训练
计算机视觉与模式识别
2024-11-27 v1
摘要
近年来,尤其是在对象分类、医学成像等计算机视觉任务中,合成数据的兴趣日益增长。先前的工作表明,由各种生成过程自动产生的合成样本可以取代真实样本并产生强大的视觉表示。这种方法解决了与真实数据相关的收集和标注成本、版权和隐私问题等难题。我们将这一趋势扩展到视频领域,适用于动作识别任务。采用分形几何,我们提出了方法,自动产生大量短视频片段的合成数据集,可用于预训练神经模型。生成的视频片段具有显著的多样性,这源于分形能够产生复杂多尺度结构的内在能力。为缩小领域差距,我们进一步识别真实视频的关键属性,并在预训练期间仔细模拟这些属性。通过彻底的消融实验,我们确定强化下游结果的属性,并为使用合成视频进行预训练提供了通用指导方针。该方法通过在 established 的动作识别数据集 HMDB51 和 UCF101 上进行微调,以及四个其他视频基准(涉及群体动作识别、细粒度动作识别和动态场景)进行评估。与标准 Kinetics 预训练相比,我们的结果在部分下游数据集上不仅接近,甚至优于。代码和合成视频样本可在 https://github.com/davidsvy/fractal_video 上获取。
引用
@article{arxiv.2411.17584,
title = {Pre-training for Action Recognition with Automatically Generated Fractal Datasets},
author = {Davyd Svyezhentsev and George Retsinas and Petros Maragos},
journal= {arXiv preprint arXiv:2411.17584},
year = {2024}
}