中文

流式视频中的时序语句定位

计算机视觉与模式识别 2023-08-15 v1 计算与语言 多媒体

摘要

本文旨在解决一项新任务——流式视频中的时序语句定位(TSGSV)。TSGSV 的目标是评估视频流与给定语句查询之间的相关性。与常规视频不同,流式视频是从特定源连续获取的,并且在监控和直播分析等许多应用中始终需要被在线处理。因此,TSGSV 具有挑战性,因为它要求模型在没有未来帧的情况下进行推断,并有效处理长历史帧,这是早期方法所未涉及的。为专门应对上述挑战,我们提出两种新方法:(1)使模型能够学习即将发生事件的 TwinNet 结构;(2)消除冗余视觉帧并强化与查询相关帧的语言引导特征压缩器。我们使用 ActivityNet Captions、TACoS 和 MAD 数据集进行了大量实验。结果证明了我们所提方法的优越性。系统的消融研究也证实了它们的有效性。

关键词

引用

@article{arxiv.2308.07102,
  title  = {Temporal Sentence Grounding in Streaming Videos},
  author = {Tian Gan and Xiao Wang and Yan Sun and Jianlong Wu and Qingpei Guo and Liqiang Nie},
  journal= {arXiv preprint arXiv:2308.07102},
  year   = {2023}
}

备注

Accepted by ACM MM 2023