BiMa: 通过场景元素引导实现文本-视频检索偏置缓解
计算机视觉与模式识别
2025-07-08 v3 人工智能
计算与语言
摘要
文本-视频检索(TVR)系统常常受到数据集中存在的视觉-语言偏置的影响,这会导致预训练的视觉-语言模型忽视关键细节。为解决这一问题,我们提出了 BiMa,一种旨在缓解视觉和文本表示中偏置的新型框架。我们的方法首先通过识别相关实体/对象和活动来生成描述每个视频的场景元素。对于视觉去偏, 我们将这些场景元素集成到视频嵌入中,以增强它们以突出显示细粒度和显著细节。对于文本去偏,我们引入一种机制将文本特征解耦为内容和偏置组件,使模型能够专注于有意义的内容,同时单独处理偏置信息。 extensive 实验和消融研究在五个主要 TVR 基准数据集上(即 MSR-VTT、MSVD、LSMDC、ActivityNet 和 DiDeMo)都表明 BiMa 具有竞争的性能。此外,该模型在跨分布检索任务上的强大结果一致地验证了其偏置缓解能力。
引用
@article{arxiv.2506.03589,
title = {BiMa: Towards Biases Mitigation for Text-Video Retrieval via Scene Element Guidance},
author = {Huy Le and Nhat Chung and Tung Kieu and Anh Nguyen and Ngan Le},
journal= {arXiv preprint arXiv:2506.03589},
year = {2025}
}
备注
Accepted at ACM MM 2025