中文

MObyGaze:由专家密集标注的多模态客体化电影数据集

计算机视觉与模式识别 2025-05-29 v1

摘要

表征和量化视听叙事内容中的性别表征差异,对于理解刻板印象如何在屏幕上延续是必要的。在本文中,我们考察了客体化这一高层概念构建,并向机器学习社区引入了一项新的人工智能任务:表征和量化在电影中产生客体化的复杂多模态(视觉、语音、音频)时序模式。基于电影研究和心理学,我们通过一个结构化同义词词典定义了客体化概念构建,该词典涉及通过跨越 3 种模态的 11 个概念表现出来的 5 个子构建。我们引入了多模态客体化凝视 (MObyGaze) 数据集,该数据集由 20 部电影组成,专家在自由划定的片段上对客体化水平和概念进行了密集标注:它包含 43 小时视频中的 6072 个片段,具有细粒度的定位和分类。我们制定了不同的学习任务,提出并研究了在少量标注者情况下从标签多样性中学习的最佳方法,并对近期的视觉、文本和音频模型进行了基准测试,展示了该任务的可行性。我们向社区公开了我们的代码和数据集,并以 Croissant 格式进行了描述:https://anonymous.4open.science/r/MObyGaze-F600/。

关键词

引用

@article{arxiv.2505.22084,
  title  = {MObyGaze: a film dataset of multimodal objectification densely annotated by experts},
  author = {Julie Tores and Elisa Ancarani and Lucile Sassatelli and Hui-Yin Wu and Clement Bergman and Lea Andolfi and Victor Ecrement and Remy Sun and Frederic Precioso and Thierry Devars and Magali Guaresi and Virginie Julliard and Sarah Lecossais},
  journal= {arXiv preprint arXiv:2505.22084},
  year   = {2025}
}