中文

超越专业化:评估多模态大语言模型在年龄和性别估计中的能力

计算机视觉与模式识别 2025-01-22 v4 人工智能 机器学习

摘要

多模态大语言模型 (MLLMs) 最近获得了极大的关注。强大的商业模型如 ChatGPT-4V 和 Gemini,以及开源模型如 LLaVA,本质上是通用模型,并被应用于解决各种任务,包括计算机视觉领域的任务。这些神经网络拥有如此强大的通用知识和推理能力,以至于事实证明它们甚至能够处理那些未经过专门训练的任务。我们将迄今为止最强大的 MLLMs(ShareGPT4V、ChatGPT、LLaVA-Next)在年龄和性别估计这一专业化任务中的能力,与我们最先进的专用模型 MiVOLO 进行了比较。我们还更新了 MiVOLO,并在本文中提供了细节和新指标。这种比较产生了一些关于参与模型优势和劣势的有趣结果和见解。此外,我们尝试了多种方法来微调 ShareGPT4V 模型以适应此特定任务,旨在在这一特定挑战中达到最先进的结果。尽管此类模型在生产环境中并不实用,因为与像 MiVOLO 这样的专用模型相比其成本极其高昂,但它可能在某些任务(如数据标注)中非常有用。

关键词

引用

@article{arxiv.2403.02302,
  title  = {Beyond Specialization: Assessing the Capabilities of MLLMs in Age and Gender Estimation},
  author = {Maksim Kuprashevich and Grigorii Alekseenko and Irina Tolstykh},
  journal= {arXiv preprint arXiv:2403.02302},
  year   = {2025}
}