面向视频描述频率扩散的精炼语义增强方法
计算机视觉与模式识别
2022-12-20 v2 人工智能
计算与语言
摘要
视频描述旨在生成准确描述给定视频的自然语言句子。现有方法通过在编码阶段探索更丰富的视觉表征或提升解码能力来获得良好生成效果。然而,长尾问题阻碍了这些方法对低频词元的处理——这些词元虽出现稀少却承载关键语义,在细节生成中起着至关重要的作用。本文提出一种新颖的精炼语义增强方法——面向频率扩散的精炼语义增强(RSFD),这是一种持续感知低频词元语言表征的描述模型。具体而言,提出频率感知扩散(FAD)模块以理解低频词元的语义,从而突破生成限制。通过这种方式,描述通过促进对出现不足词元的吸收而得到精炼。基于 FAD,我们设计了发散语义监督器(DSS)模块,以补偿扩散过程带来的高频词元信息损失,其中低频词元的语义被进一步强调以缓解长尾问题。大量实验表明,RSFD 在两个基准数据集(MSR-VTT 和 MSVD)上优于当前最优方法,证明增强低频词元语义可获得有竞争力的生成效果。代码见 https://github.com/lzp870/RSFD。
引用
@article{arxiv.2211.15076,
title = {Refined Semantic Enhancement towards Frequency Diffusion for Video Captioning},
author = {Xian Zhong and Zipeng Li and Shuqin Chen and Kui Jiang and Chen Chen and Mang Ye},
journal= {arXiv preprint arXiv:2211.15076},
year = {2022}
}