中文

EVA02-AT:基于空间-时间旋转位置编码与对称优化的轨迹视频-语言理解

计算机视觉与模式识别 2025-06-18 v1 人工智能

摘要

轨迹视频-语言理解要求具备高效性与准确的时空建模。现有方法面临三个关键挑战:1) 多阶段预训练管线导致的预训练成本过高;2) 手动划分的3D旋转位置编码效果不佳,阻碍特征互动;3) 软标签多实例检索中的学习目标不够精确,忽略负样本对之间的关联。本文引入EVA02-AT,这是一套针对轨迹视频理解任务的EVA02-based视频-语言基础模型。EVA02-AT首先通过单阶段预训练高效地将基于图像的CLIP模型迁移为统一视频编码器。其次,本文提出空间-时间旋转位置编码及联合注意力机制,取代对孤立维度应用旋转位置编码,能够在整个隐藏维度上有效地对时空信息进行编码。这种联合的时空特征编码使模型能够学习跨轴关系,这对于准确建模视频中的运动与互动至关重要。最后,针对多实例视频-语言检索任务,本文引入对称多相似性(SMS)损失函数及新颖的训练框架,使正负样本对的所有软标签都得到提升,从而提供更精确的学习目标。广泛的在Ego4D、EPIC-Kitchens-100和Charades-Ego上的零样态和微调实验表明,EVA02-AT在多样化的轨迹视频-语言任务中以更少的参数实现了最先进的性能。采用SMS损失的模型在多实例检索基准测试中也显示出显著的性能提升。我们的代码和模型已公开发布于https://github.com/xqwang14/EVA02-AT。

关键词

引用

@article{arxiv.2506.14356,
  title  = {EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization},
  author = {Xiaoqi Wang and Yi Wang and Lap-Pui Chau},
  journal= {arXiv preprint arXiv:2506.14356},
  year   = {2025}
}