中文

PRE-MAP:面向高分辨率多属性点预测的个性化强化眼动追踪多模态大语言模型

计算机视觉与模式识别 2025-07-28 v1

摘要

视觉选择性注意受个体偏好驱动,通过连接主观认知机制与客观视觉元素来调节人类对视觉刺激的优先级排序,从而引导动态视觉场景的语义解释和层次化处理。然而,现有模型和数据集大多忽略了主观认知多样性对注视行为的影响。传统的显著性预测模型通常采用分割方法,依赖低分辨率图像生成显著性热力图,随后上采样至原始分辨率,这限制了它们捕捉个性化注意力模式的能力。此外,多模态大语言模型受到幻觉等因素的制约,在涉及多点预测的任务中严格遵循预期格式的成本很高,且难以实现精确的点定位。为解决这些局限,我们提出了面向广告视频的主观个性化注意力数据集SPA-ADV,这是一个大规模多模态数据集,捕捉了来自4500多名不同年龄和性别的参与者对486个视频的注视行为。此外,我们提出了PRE-MAP,一种新颖的眼动追踪显著性模型,它通过强化学习优化的眼动追踪来表征个性化视觉差异,该模型基于多模态大语言模型构建,并由多属性用户画像引导进行点预测。为确保多模态大语言模型生成的预测点既格式正确又空间精确,我们引入了一致性组相对策略优化,其灵感来源于眼动点的可变性和多属性画像。在SPA-ADV和其他基准上的大量实验证明了我们方法的有效性。代码和数据集可在 \href{https://github.com/mininglamp-MLLM/PRE-MAP}{此URL} 获取。

关键词

引用

@article{arxiv.2507.19213,
  title  = {PRE-MAP: Personalized Reinforced Eye-tracking Multimodal LLM for High-Resolution Multi-Attribute Point Prediction},
  author = {Hanbing Wu and Ping Jiang and Anyang Su and Chenxu Zhao and Tianyu Fu and Minghui Wu and Beiping Tan and Huiying Li},
  journal= {arXiv preprint arXiv:2507.19213},
  year   = {2025}
}