DemaFormer: 基于阻尼指数移动平均Transformer与能量建模的时间语言定位
计算机视觉与模式识别
2026-05-13 v2 计算与语言
摘要
时间语言定位旨在定位与自然语言查询语义对应的视频片段。最近的研究采用注意力机制来学习视频片段与文本查询之间的关系。然而,朴素注意力可能无法适当地捕捉这种关系,导致分布无效,难以将目标视频片段与其余片段分离。为了解决这个问题,我们提出了一个基于能量的模型框架来显式学习片段-查询分布。此外,我们提出了DemaFormer,一种新颖的基于Transformer的架构,利用具有可学习阻尼因子的指数移动平均来有效编码片段-查询输入。在四个公开的时间语言定位数据集上的综合实验展示了我们的方法相对于最先进基线的优越性。
引用
@article{arxiv.2312.02549,
title = {DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding},
author = {Thong Nguyen and Xiaobao Wu and Xinshuai Dong and Cong-Duy Nguyen and See-Kiong Ng and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2312.02549},
year = {2026}
}
备注
Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer