中文

视频中的时序语句定位:综述与未来方向

计算机视觉与模式识别 2023-04-26 v3 人工智能 计算与语言 多媒体

摘要

视频中的时序语句定位(temporal sentence grounding in videos, TSGV),亦称自然语言视频定位(natural language video localization, NLVL)或视频时刻检索(video moment retrieval, VMR),旨在从未经裁剪的视频中检索出与语言查询语义对应的时间片段。TSGV 连接计算机视觉与自然语言,已引起两个领域研究者的显著关注。本综述试图总结 TSGV 的基本概念、当前研究现状及未来研究方向。作为背景,我们以教程风格给出 TSGV 中功能组件的通用结构:从原始视频与语言查询的特征提取,到目标片段的答案预测。随后我们回顾多模态理解与交互技术,这是 TSGV 实现两模态间有效对齐的关键焦点。我们构建 TSGV 技术的分类体系,并详述不同类别下方法的优劣。最后,我们讨论当前 TSGV 研究存在的问题,并分享对有望研究方向的见解。

关键词

引用

@article{arxiv.2201.08071,
  title  = {Temporal Sentence Grounding in Videos: A Survey and Future Directions},
  author = {Hao Zhang and Aixin Sun and Wei Jing and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2201.08071},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)