StructAlign:用于持续文本到视频检索的结构化跨模态对齐
计算机视觉与模式识别
2026-04-28 v2
摘要
持续文本到视频检索 (CTVR) 是一种具有挑战性的多模态持续学习设置,模型必须在保持先前学习内容的文本-视频对齐准确性的同时,逐步学习新的语义类别,因此尤其容易受到灾难性遗忘。CTVR 的关键挑战在于特征漂移,表现为两种形式:由每个模态内部持续学习导致的模内特征漂移,以及导致模态错位的跨模态非合作特征漂移。为缓解这些问题,我们提出 StructAlign,一种用于 CTVR 的结构化跨模态对齐方法。首先,StructAlign 引入单胞等角紧致帧 (ETF) 几何作为统一的几何先验,以缓解模态错位。基于此几何先验,我们设计了跨模态 ETF 对齐损失,将文本和视频特征与类别级 ETF 原型对齐,鼓励学习到的表征形成近似单胞 ETF 几何。此外,为了抑制模内特征漂移,我们设计了跨模态关系保持损失,该损失利用互补模态来保持跨模态相似性关系,为特征更新提供稳定的关系监督。通过同时解决跨模态和模内特征漂移,StructAlign 有效缓解了 CTVR 中的灾难性遗忘。大量实验表明,我们的方法在基准数据集上 consistently 优于最新的持续检索方法。
引用
@article{arxiv.2601.20597,
title = {StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval},
author = {Shaokun Wang and Weili Guan and Jizhou Han and Jianlong Wu and Yupeng Hu and Liqiang Nie},
journal= {arXiv preprint arXiv:2601.20597},
year = {2026}
}