超图多模态大语言模型:利用脑电与眼动模态评估视频理解中的异质响应
计算机视觉与模式识别
2024-09-06 v3
摘要
对视频创意和内容的理解常因人而异,不同年龄、经验和性别的人群在关注点和认知水平上存在差异。目前该领域尚缺乏相关研究,且现有的大多数基准测试存在若干缺陷:1)模态数量有限且答案长度受限;2)视频中的内容和场景过于单调,传达的寓意和情感过于简单。为弥合与现实世界应用的差距,我们引入了一个大规模广告视频主观响应指标数据集,即 SRI-ADV。具体而言,我们收集了不同人群在观看相同视频内容时脑电(EEG)和眼动区域的真实变化。利用这一多模态数据集,我们开发了任务和协议,以分析和评估不同用户对视频内容认知理解的程度。伴随该数据集,我们设计了一个超图多模态大语言模型(HMLLM),以探索不同人群、视频元素、EEG 和眼动指标之间的关联。HMLLM 能够弥合丰富模态间的语义鸿沟,并整合跨模态信息以执行逻辑推理。在 SRI-ADV 及其他基于视频的生成性能基准上的广泛实验评估证明了我们方法的有效性。代码和数据集将发布于 https://github.com/mininglamp-MLLM/HMLLM。
引用
@article{arxiv.2407.08150,
title = {Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding},
author = {Minghui Wu and Chenxu Zhao and Anyang Su and Donglin Di and Tianyu Fu and Da An and Min He and Ya Gao and Meng Ma and Kun Yan and Ping Wang},
journal= {arXiv preprint arXiv:2407.08150},
year = {2024}
}
备注
Accepted by ACM MULTIMEDIA 2024