中文

面向数据高效动作检测的组相对增广

计算机视觉与模式识别 2025-07-30 v1 机器学习

摘要

仅凭少量样本为视频-语言模型(VLM)适配动作检测面临过拟合和场景级预训练与所需人员中心理解之间的细粒度不匹配等挑战。我们提出一种高效适配策略,将参数高效调优(LoRA)与 novel 可学习内部特征增强相结合。应用于冻结的VLM主干网络中通过FiLM,这些增强直接生成与任务相关的多样化特征变体。此外,我们引入组加权损失函数,基于每个增广样本相对于组平均的预测偏差,动态调节其训练贡献,以促进对信息且合理增强的学习。我们在复杂的多标签、多人员动作检测数据集(AVA、MOMA)上证明了本方法的有效性,实现了强大的mAP性能,展示了在有限样本下适配VLM的显著数据效率。

关键词

引用

@article{arxiv.2507.21353,
  title  = {Group Relative Augmentation for Data Efficient Action Detection},
  author = {Deep Anil Patel and Iain Melvin and Zachary Izzo and Martin Renqiang Min},
  journal= {arXiv preprint arXiv:2507.21353},
  year   = {2025}
}