中文

MIP-GAF:基于多模态大语言模型注释的“最重要人物”定位与群体情境理解基准

计算机视觉与模式识别 2024-09-11 v1 机器学习 多媒体

摘要

估计任何社交场景中的“最重要人物”(Most Important Person, MIP)是一个具有情境复杂性和标注数据稀缺性的挑战性问题。此外,MIP 估计的因果关系 aspects 具有主观性和多样性。为此,我们旨在通过为识别图像中关于“最重要人物”(MIP)的人类感知意见而标注大规模“野外”数据集来解决此问题。本文提供了我们基于多模态大语言模型(Multimodal Large Language Model, MLLM)的数据标注策略的详尽描述,并进行了数据质量分析。进一步地,我们利用最新 MIP 定位方法对该数据集进行了全面基准测试,结果表明其性能相对于现有数据集存在显著下降。性能下降表明现有的 MIP 定位算法必须对“野外”情境更具鲁棒性。我们相信该数据集将在构建下一代社交情境理解方法中发挥关键作用。代码和数据已提供于 https://github.com/surbhimadan92/MIP-GAF。

关键词

引用

@article{arxiv.2409.06224,
  title  = {MIP-GAF: A MLLM-annotated Benchmark for Most Important Person Localization and Group Context Understanding},
  author = {Surbhi Madan and Shreya Ghosh and Lownish Rai Sookha and M. A. Ganaie and Ramanathan Subramanian and Abhinav Dhall and Tom Gedeon},
  journal= {arXiv preprint arXiv:2409.06224},
  year   = {2024}
}

备注

Accepted for publication at WACV 2025