MAViC:面向视频字幕的多模态主动学习
计算机视觉与模式识别
2022-12-22 v1 计算与语言
机器学习
摘要
训练视频字幕模型需要大量带标注的视频-字幕对,导致标注成本高昂。主动学习有助于降低这些标注需求。然而,视频字幕的主动学习具有挑战性,因为一段视频存在多个语义等价的合理字幕,即便信息量较少的样本也会产生高熵输出。此外,视频字幕算法本质上是多模态的,包含视觉编码器与语言解码器。进一步,输出的序列与组合特性使问题更具挑战。本文提出 MAViC,其利用我们提出的基于多模态语义感知序列熵(M-SASE)的获取函数,以解决视频字幕主动学习方法的各类挑战。我们的方法在获取函数中融合了视觉与语言两个维度的语义相似度与不确定性。详实的实验从经验上证明了 M-SASE 在视频字幕主动学习中的有效性,并以较大幅度优于基线方法。
引用
@article{arxiv.2212.11109,
title = {MAViC: Multimodal Active Learning for Video Captioning},
author = {Gyanendra Das and Xavier Thomas and Anant Raj and Vikram Gupta},
journal= {arXiv preprint arXiv:2212.11109},
year = {2022}
}