图算子可学习扩展用于多模态特征融合
计算机视觉与模式识别
2025-03-03 v4 人工智能
机器学习
摘要
在计算机视觉任务中,特征常来自多样化的表征、领域(例如室内与户外)以及模态(例如文本、图像和视频)。有效地融合这些特征对于实现稳健的性能至关重要,尤其是受益于像视觉语言模型这类强大的预训练模型。然而,常见的融合方法,如拼接、逐元素操作和非线性技术,往往难以捕获结构关系、深层特征交互,同时在跨域或跨模态的特征对齐和效率方面存在问题。本文我们转向低维、可解释的图空间,通过构建在不同层次上编码特征关系的关系图(例如 clip、帧、patch、token 等)。为捕获更深层的交互,我们通过迭代图关系更新来扩展图,并引入可学习的图融合算子,以整合这些扩展后的关系,以实现更有效的融合。我们的做法具有关系导向性, operates 在同质空间中,且具有数学原理,类似于通过多线性多项式进行逐元素关系得分聚合。我们在视频异常检测任务上展示了基于图的融合方法的有效性,表明其在多表征、多模态和多域特征融合任务中均表现出色。
引用
@article{arxiv.2410.01506,
title = {Learnable Expansion of Graph Operators for Multi-Modal Feature Fusion},
author = {Dexuan Ding and Lei Wang and Liyun Zhu and Tom Gedeon and Piotr Koniusz},
journal= {arXiv preprint arXiv:2410.01506},
year = {2025}
}
备注
Accepted at the Thirteenth International Conference on Learning Representations (ICLR 2025)