将粒度偏差作为间隔引入对比损失用于视频描述生成
计算机视觉与模式识别
2023-11-28 v1 多媒体
摘要
视频描述生成模型容易受短语长尾分布的影响,这使得描述模型倾向于生成模糊句子而非准确句子。然而,现有的去偏策略往往借助外部知识构建词的依赖树,或通过复杂损失与额外输入特征来细化频率分布,缺乏可解释性且难以训练。为减轻粒度偏差对模型的影响,我们引入了一种基于统计的偏差提取器。该提取器量化句子与视频中的信息量,估计一个视频-句子对受粒度偏差影响的可能性。此外,随着将对比学习方法集成到视频描述任务中的趋势日益增长,我们使用双向三元组损失在一批数据中获得更多负样本。随后,我们将间隔分数纳入对比学习损失,为头部与尾部句子建立不同的训练目标。该方法提升了模型在尾部样本上的训练效果。我们这种简单而有效的、融入粒度偏差的损失称为间隔-对比损失(Margin-Contrastive Loss,GMC Loss)。所提模型在 MSRVTT 上以 CIDEr 57.17 取得最先进性能,在 MSVD 上 CIDEr 高达 138.68。
引用
@article{arxiv.2311.14977,
title = {Incorporating granularity bias as the margin into contrastive loss for video captioning},
author = {Jiayang Gu and Fengming Yao},
journal= {arXiv preprint arXiv:2311.14977},
year = {2023}
}
备注
6 pages, 2 figures