TRIANGLE:实现超越余弦相似度的多模态对齐
机器学习
2025-09-30 v1 人工智能
计算机视觉与模式识别
摘要
多模态学习通过整合来自多种模态的信息来构建更全面的表示,在推进人工智能系统方面发挥着关键作用。尽管其重要性不言而喻,但当前最先进的模型仍然存在严重的局限性,阻碍了完全多模态模型的成功开发。此类方法可能无法提供所有相关模态均已有效对齐的指标。因此,某些模态可能未对齐,从而破坏了模型在下游任务中的有效性,在这些任务中,多种模态本应提供模型未能利用的额外信息。在本文中,我们提出了 TRIANGLE:三模态神经几何学习(TRI-modAl Neural Geometric LEarning),这是一种直接在模态嵌入所张成的高维空间中计算的新型相似度度量。TRIANGLE 通过三角形面积相似度改进了三种模态的联合对齐,避免了额外的融合层或成对相似度。当将其纳入对比损失以替换余弦相似度时,TRIANGLE 显著提升了多模态建模的性能,同时产生了可解释的对齐依据。在视频-文本和音频-文本检索或音频-视频分类等三模态任务中的广泛评估表明,TRIANGLE 在不同数据集上均取得了最先进的结果,将基于余弦的方法的性能最高提升了 9 个点的 Recall@1。
引用
@article{arxiv.2509.24734,
title = {A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity},
author = {Giordano Cicchetti and Eleonora Grassucci and Danilo Comminiello},
journal= {arXiv preprint arXiv:2509.24734},
year = {2025}
}
备注
NeurIPS 2025