面向视频中语言驱动动作定位的实体感知与运动感知 Transformer
计算机视觉与模式识别
2022-05-13 v1 多媒体
摘要
视频中语言驱动的动作定位是一项具有挑战性的任务,不仅涉及视觉-语言匹配,还涉及动作边界预测。近期通过将对语言查询与视频片段对齐取得了进展,但精确边界的估计仍鲜有探索。本文提出实体感知与运动感知 Transformer,通过先用实体查询粗略定位片段、再用运动查询在收缩的时间区域内精细预测精确边界,逐步定位视频中的动作。实体感知 Transformer 通过跨模态与跨帧注意力将文本实体融入视觉表征学习,以助于关注与动作相关的视频片段。运动感知 Transformer 通过将长短期记忆整合进自注意力模块,在多个时间尺度上捕捉细粒度运动变化,以进一步提升动作边界预测的精度。在 Charades-STA 与 TACoS 数据集上的大量实验表明,我们的方法优于现有方法。
引用
@article{arxiv.2205.05854,
title = {Entity-aware and Motion-aware Transformers for Language-driven Action Localization in Videos},
author = {Shuo Yang and Xinxiao Wu},
journal= {arXiv preprint arXiv:2205.05854},
year = {2022}
}
备注
accepted by IJCAI-22, Codes are available at https://github.com/shuoyang129/EAMAT