面向视频时刻检索的多模态跨域对齐网络
计算机视觉与模式识别
2026-05-26 v3 人工智能
信息检索
多媒体
摘要
作为多媒体信息检索中日益流行的任务,视频时刻检索(VMR)旨在依据给定语言查询从未剪辑视频中定位目标时刻。多数已有方法严重依赖大量人工标注(即时刻边界),而实践中获取此类标注极为昂贵。此外,由于不同数据集间的域差距,将这些预训练模型直接应用于未见域会导致性能显著下降。本文关注一项新任务:跨域VMR,其中某一域(“源域”)具备全标注数据集,而目标域(“目标域”)仅含无标注数据集。据我们所知,我们首次对跨域VMR展开研究。为应对该新任务,提出一种新颖的多模态跨域对齐(MMCDA)网络,将标注知识从源域迁移至目标域。然而,由于源域与目标域间的域差异以及视频与查询间的语义鸿沟,直接将训练模型用于目标域通常致性能下降。为此,我们设计三个新颖模块:(i)域对齐模块,用于对齐各模态不同域间的特征分布;(ii)跨模态对齐模块,旨在将视频与查询特征映射至联合嵌入空间,并对齐目标域内不同模态间的特征分布;(iii)特定对齐模块,试图获取特定帧与给定查询间的细粒度相似度以实现最优定位。通过联合训练这三模块,我们的MMCDA可学习域不变且语义对齐的跨模态表示。
引用
@article{arxiv.2209.11572,
title = {Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval},
author = {Xiang Fang and Daizong Liu and Pan Zhou and Yuchong Hu},
journal= {arXiv preprint arXiv:2209.11572},
year = {2026}
}
备注
Accepted by IEEE Transactions on Multimedia