中文

基于时空图转换器的视频语言对齐

机器学习 2025-10-08 v4 人工智能 统计方法学 机器学习

摘要

视频语言对齐是一种关键的多模态任务,受益于各种下游应用,如视频文本检索和视频问答。现有方法要么利用视频文本对中的多模态信息,要么应用全局和局部对齐技术以提高对齐精度。然而,这些方法常常未充分探索视频中视觉标记之间的时空关系以及不同视频文本对之间的时空关系。在本文中,我们提出了一种新颖的时空图转换器模块,用于统一学习视频语言对齐的空间和时间上下文(称为 STGT)。具体而言,我们的 STGT 将时空图结构信息与转换器块中的注意力相结合,有效利用时空上下文。如此一来,我们可以建模视觉标记之间的关系,从而提高视频文本对齐精度以利于下游任务。此外,我们提出了一种自相似对齐损失,用于探索视频和文本中固有的自相似性。通过对比学习获得初始优化后,可进一步促进视频文本之间的对齐精度。在挑战性的下游任务上进行实验,包括视频文本检索和视频问答,验证了我们方法的卓越性能。

关键词

引用

@article{arxiv.2407.11676,
  title  = {SKADA-Bench: Benchmarking Unsupervised Domain Adaptation Methods with Realistic Validation On Diverse Modalities},
  author = {Yanis Lalou and Théo Gnassounou and Antoine Collas and Antoine de Mathelin and Oleksii Kachaiev and Ambroise Odonnat and Alexandre Gramfort and Thomas Moreau and Rémi Flamary},
  journal= {arXiv preprint arXiv:2407.11676},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research