中文

利用 LLM 驱动的查询扩展增强语言驱动动作定位中的边界预测

计算机视觉与模式识别 2025-06-02 v1

摘要

视频中的语言驱动动作定位不仅需要语言查询与视频片段之间的语义对齐,还需要预测动作边界。然而,语言查询主要描述动作的主要内容,通常缺乏动作起始和结束边界的具体细节,这增加了人工边界标注的主观性,并导致训练数据中的边界不确定性。在本文中,一方面,我们提议通过 LLM 生成动作起始和结束边界的文本描述来扩展原始查询,这可以为定位提供更详细的边界线索,从而减少边界不确定性的影响。另一方面,为了增强训练期间对边界不确定性的容忍度,我们提议通过计算帧与扩展查询之间的语义相似度以及帧与标注边界帧之间的时间距离,来对动作边界的概率分数进行建模。这可以提供更一致的边界监督,从而提高训练的稳定性。我们的方法与模型无关,可以即插即用地无缝集成到任何现有的语言驱动动作定位模型中。在多个数据集上的实验结果证明了我们方法的有效性。

关键词

引用

@article{arxiv.2505.24282,
  title  = {LLM-powered Query Expansion for Enhancing Boundary Prediction in Language-driven Action Localization},
  author = {Zirui Shang and Xinxiao Wu and Shuo Yang},
  journal= {arXiv preprint arXiv:2505.24282},
  year   = {2025}
}