中文

捕捉丰富的行为表示:一种用于视频描述的动态动作语义感知图Transformer

计算机视觉与模式识别 2025-02-20 v1

摘要

现有的视频描述方法仅提供对物体行为的浅层或简单表示,导致描述肤浅且含糊。然而,物体行为是动态且复杂的。为了全面捕捉物体行为的本质,我们提出了一种动态动作语义感知图Transformer。首先,设计了多尺度时间建模模块,以灵活学习长期和短期的潜在动作特征。它不仅获取跨时间尺度的潜在动作特征,还考虑局部的潜在动作细节,增强了潜在动作表示的连贯性和敏感性。其次,提出了视觉-动作语义感知模块,以自适应地捕捉与物体行为相关的语义表示,增强动作表示的丰富性和准确性。通过利用这两个模块的协同作用,我们可以获取丰富的行为表示,从而生成类似人类的自然描述。最后,将这些丰富的行为表示和物体表示用于构建时序物体-动作图,并将其输入到图Transformer中,以建模物体与动作之间复杂的时序依赖关系。为避免在推理阶段增加复杂性,物体的行为知识将通过知识蒸馏被蒸馏到一个简单网络中。在 MSVD 和 MSR-VTT 数据集上的实验结果表明,所提出的方法在多个指标上均取得了显著的性能提升。

关键词

引用

@article{arxiv.2502.13754,
  title  = {Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning},
  author = {Caihua Liu and Xu Li and Wenjing Xue and Wei Tang and Xia Feng},
  journal= {arXiv preprint arXiv:2502.13754},
  year   = {2025}
}

备注

5 pages, 3 figures, published ICASSP