中文

面向时序视频定位中预训练语言模型参数高效集成

计算机视觉与模式识别 2023-05-26 v2 计算与语言

摘要

本文探讨时序视频定位(Temporal Video Grounding, TVG)任务:给定一段未裁剪视频与自然语言句子查询,目标是识别并确定查询所描述的视频中动作实例的时间边界。近期工作通过以大型预训练语言模型(PLM)改进查询输入来解决该任务,代价是更昂贵的训练。然而,这种集成的效果并不清晰,因为这些工作同时也提出了视觉输入的改进。因此,本文研究PLM在TVG中的效果,并评估使用NLP适配器进行参数高效训练的可行性。我们将流行的PLM与若干现有方法相结合,测试不同适配器以降低额外参数的影响。在三个具挑战性数据集上的结果表明,在不改变视觉输入的情况下,TVG模型从PLM集成与微调中大幅受益,凸显了句子查询表示在该任务中的重要性。此外,NLP适配器是全面微调的有效替代方案,尽管其并非为我们任务专门设计,仍允许在更大TVG模型中集成PLM,并给出可与SOTA模型媲美的结果。最后,我们的结果阐明了不同场景下何种适配器效果最佳。

关键词

引用

@article{arxiv.2209.13359,
  title  = {Towards Parameter-Efficient Integration of Pre-Trained Language Models In Temporal Video Grounding},
  author = {Erica K. Shimomoto and Edison Marrese-Taylor and Hiroya Takamura and Ichiro Kobayashi and Hideki Nakayama and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2209.13359},
  year   = {2023}
}

备注

Accepted for Findings of ACL2023