中文

迈向多模态感知指标的统一基准与模型

计算机视觉与模式识别 2024-12-17 v1 机器学习

摘要

人类对单模态和多模态输入间相似性的感知高度复杂,这使得开发能够准确模拟该感知的自动化指标极具挑战性。通用视觉-语言模型(如 CLIP 和大型多模态模型 LMMs)可作为零样本感知指标,近期也有若干研究开发了专用于特定狭窄感知任务的模型。然而,现有感知指标与人类感知的契合程度仍不明确。为研究此问题,我们引入了 UniSim-Bench,这是一个包含 7 个多模态感知相似性任务、共计 25 个数据集的基准测试。我们的评估表明,虽然通用模型在平均意义上表现尚可,但在单个任务上往往落后于专用模型。相反,针对特定任务微调的指标无法很好地泛化到未见但相关的任务上。作为迈向统一多任务感知相似性指标的第一步,我们在 UniSim-Bench 任务的子集上对基于编码器的视觉-语言模型和生成式视觉-语言模型进行了微调。该方法获得了最高的平均性能,在某些情况下甚至超越了特定任务模型。尽管如此,这些模型在泛化到未见任务方面仍存在困难,凸显了学习一个能够捕捉人类相似性概念的鲁棒、统一感知相似性指标所面临的持续挑战。代码和模型可在 https://github.com/SaraGhazanfari/UniSim 获取。

关键词

引用

@article{arxiv.2412.10594,
  title  = {Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics},
  author = {Sara Ghazanfari and Siddharth Garg and Nicolas Flammarion and Prashanth Krishnamurthy and Farshad Khorrami and Francesco Croce},
  journal= {arXiv preprint arXiv:2412.10594},
  year   = {2024}
}