超越场景:动作识别中背景偏置的分析与缓解
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
人类动作识别模型常依赖背景线索而非人体运动和姿态进行预测,这种行为称为背景偏置。我们系统性地分析了背景偏置在分类模型、对比文本图像预训练模型以及视频大语言模型(VLLM)中的表现,发现所有模型都强烈倾向于依赖背景推理。随后,我们提出缓解分类模型偏置的策略,表明纳入分割后的人体输入可将背景偏置降低 3.78%。最后,我们探索了 VLLM 的手动和自动提示调优,证明通过提示设计可将预测引导至人体关注推理,提升幅度达 9.85%。
引用
@article{arxiv.2512.17953,
title = {Seeing Beyond the Scene: Analyzing and Mitigating Background Bias in Action Recognition},
author = {Ellie Zhou and Jihoon Chung and Olga Russakovsky},
journal= {arXiv preprint arXiv:2512.17953},
year = {2025}
}
备注
Accepted to NeurIPS 2025 Workshops: SPACE in Vision, Language, and Embodied AI; and What Makes a Good Video: Next Practices in Video Generation and Evaluation