中文

提示大语言模型重构查询以用于视频时刻定位

计算机视觉与模式识别 2023-06-07 v1

摘要

时刻定位任务旨在为给定的自然语言查询在未裁剪视频中定位一个时间片段。由于未裁剪视频包含高度冗余的内容,查询的质量对于准确进行时刻定位至关重要,即查询应提供关于目标片段的精确信息,以便定位模型理解在视频中需要寻找什么。然而,当前数据集中的自然语言查询对于现有模型而言可能并不易于理解。例如,Ego4D 数据集使用疑问句作为查询来描述相对复杂的片段。尽管对人类而言自然且直观,但理解此类疑问句对于 2D-TAN 等主流时刻定位模型来说具有挑战性。受大语言模型近期成功的启发,尤其是其理解和生成复杂自然语言内容的能力,在本扩展摘要中,我们早期尝试使用大语言模型将时刻查询重构为一组指令,并使其对定位模型更加友好。

关键词

引用

@article{arxiv.2306.03422,
  title  = {Prompting Large Language Models to Reformulate Queries for Moment Localization},
  author = {Wenfeng Yan and Shaoxiang Chen and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2306.03422},
  year   = {2023}
}

备注

4 pages, 2 figures