中文

STELLA:基于时空局部对齐的持续音视频预训练

计算机视觉与模式识别 2024-05-29 v3 机器学习

摘要

在不断演进的世界中,随时间持续学习多种音视频语义对于音频相关推理任务至关重要。然而,这是一个非平凡问题并带来两个关键挑战:音视频对之间稀疏的时空相关性,以及遗忘音视频关系的多模态相关性覆盖。为解决该问题,我们提出一种新的持续音视频预训练方法,包含两个新思路:(1)局部块重要性评分:我们引入多模态编码器以确定每个块的重要性分数,强调语义交织的音视频块。(2)回放引导的相关性评估:为减少因漂移对已学视听知识的破坏,我们提出在当前步对过去步评估块的相关性,以识别与过去步表现出高相关性的块。基于这两个思路的结果,我们执行概率块选择以实现有效的持续音视频预训练。在多个基准上的实验验证表明,相比强持续学习基线,我们的方法在零样本检索任务中取得 3.69%p 的相对性能提升,同时将内存消耗降低约 45%。

关键词

引用

@article{arxiv.2310.08204,
  title  = {STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment},
  author = {Jaewoo Lee and Jaehong Yoon and Wonjae Kim and Yunji Kim and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2310.08204},
  year   = {2024}
}

备注

ICML 2024