视频中的时序语句定位:综述与未来方向
计算机视觉与模式识别
2023-04-26 v3 人工智能
计算与语言
多媒体
摘要
视频中的时序语句定位(temporal sentence grounding in videos, TSGV),亦称自然语言视频定位(natural language video localization, NLVL)或视频时刻检索(video moment retrieval, VMR),旨在从未经裁剪的视频中检索出与语言查询语义对应的时间片段。TSGV 连接计算机视觉与自然语言,已引起两个领域研究者的显著关注。本综述试图总结 TSGV 的基本概念、当前研究现状及未来研究方向。作为背景,我们以教程风格给出 TSGV 中功能组件的通用结构:从原始视频与语言查询的特征提取,到目标片段的答案预测。随后我们回顾多模态理解与交互技术,这是 TSGV 实现两模态间有效对齐的关键焦点。我们构建 TSGV 技术的分类体系,并详述不同类别下方法的优劣。最后,我们讨论当前 TSGV 研究存在的问题,并分享对有望研究方向的见解。
引用
@article{arxiv.2201.08071,
title = {Temporal Sentence Grounding in Videos: A Survey and Future Directions},
author = {Hao Zhang and Aixin Sun and Wei Jing and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2201.08071},
year = {2023}
}
备注
Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)