学习无偏差以实现开放词汇动作识别
计算机视觉与模式识别
2025-07-25 v2
摘要
利用 CLIP 的有效视觉-文本对齐和静态可迁移性,最近的视频学习方法采用 CLIP 初始化,并进一步进行正则化或重组,以实现开放词汇动作识别中的可迁移性。然而,由于 CLIP 的静态偏差,这些视频学习方法倾向于过拟合于快捷静态特征,从而损害其对新颖的超出上下文动作的可迁移性。为解决此问题,我们引入 Open-MeDe,即一种用于开放词汇动作识别的新型元优化框架,具备静态去偏化能力。从可迁移性的全新视角出发,Open-MeDe 采用元学习方法,以成本效益高的方式提高已知到开放的可迁移性以及图像到视频的去偏化。具体而言,Open-MeDe 引入跨批次的元优化方案,显式鼓励视频学习器快速迁移到任意后续数据,通过虚拟评估来引导更平滑的优化景观。实际上,优化过程中不使用 CLIP 正则化,隐式地减轻了视频元学习器固有的静态偏差。我们进一步对优化轨迹应用自集成,以获取可实现对内置和超出置信 novel 数据实现稳健可迁移的通用最优参数。广泛的评估表明,Open-MeDe 不仅超越了针对内置置信开放词汇动作识别的领先正则化方法,而且在超出置信场景中显著优于前沿方法。代码已发布于 https://github.com/Mia-YatingYu/Open-MeDe。
引用
@article{arxiv.2502.20158,
title = {Learning to Generalize without Bias for Open-Vocabulary Action Recognition},
author = {Yating Yu and Congqi Cao and Yifan Zhang and Yanning Zhang},
journal= {arXiv preprint arXiv:2502.20158},
year = {2025}
}
备注
Accepted by ICCV2025 (Highlight)