面向视频检索的模态均衡嵌入
计算机视觉与模式识别
2022-05-18 v2 人工智能
信息检索
机器学习
摘要
在大型短视频分享平台上,视频搜索已成为用户发现与文本查询相关视频的主要途径。在使用在线搜索日志训练查询-视频双编码器模型时,我们发现了一种模态偏置现象:视频编码器几乎完全依赖文本匹配,而忽略视频的其他模态如视觉、音频。这种模态不平衡源于:a)模态鸿沟:查询与视频文本之间的相关性更容易学习,因为查询本身也是文本,与视频文本同模态;b)数据偏置:大多数训练样本仅通过文本匹配即可解决。在此我们分享改进首轮检索阶段的实践,包括针对模态不平衡问题的解决方案。我们提出 MBVR(Modality Balanced Video Retrieval 的缩写),包含两个关键组件:人工生成的模态打乱(MS)样本与基于视觉相关性的动态边界(DM)。它们可鼓励视频编码器对各模态给予均衡关注。通过在真实世界数据集上的大量实验,我们从经验上表明该方法在解决模态偏置问题上既有效又高效。我们还将 MBVR 部署于大型视频平台,并在 A/B 测试与人工 GSB 评估中观察到相较高度优化基线的统计显著增益。
引用
@article{arxiv.2204.08182,
title = {Modality-Balanced Embedding for Video Retrieval},
author = {Xun Wang and Bingqing Ke and Xuanping Li and Fangyu Liu and Mingyu Zhang and Xiao Liang and Qiushi Xiao and Cheng Luo and Yue Yu},
journal= {arXiv preprint arXiv:2204.08182},
year = {2022}
}
备注
Accepted by SIGIR-2022, short paper