中文

UniAR:预测视觉内容上人类注意力和反应的统一模型

计算机视觉与模式识别 2024-11-01 v3

摘要

人类行为建模的进展涉及理解隐式的早期感知行为(如人类注意力)和显式的后期行为(如主观偏好或点赞)。然而,大多数先前的研究孤立地建模隐式和显式人类行为,并且通常局限于特定类型的视觉内容。我们提出UniAR——一个跨多种视觉内容的人类注意力和偏好行为的统一模型。UniAR利用多模态Transformer预测主观反馈(如满意度或美学质量),以及底层的人类注意力或交互热图和观看顺序。我们在涵盖自然图像、网页和图形设计的多样化公共数据集上训练UniAR,并在多个图像领域和行为建模任务的多个基准上实现了SOTA性能。潜在应用包括提供关于UI/视觉内容有效性的即时反馈,并使设计师和内容创建模型能够优化其创作以实现以人为中心的改进。

关键词

引用

@article{arxiv.2312.10175,
  title  = {UniAR: A Unified model for predicting human Attention and Responses on visual content},
  author = {Peizhao Li and Junfeng He and Gang Li and Rachit Bhargava and Shaolei Shen and Nachiappan Valliappan and Youwei Liang and Hongxiang Gu and Venky Ramachandran and Golnaz Farhadi and Yang Li and Kai J Kohlhoff and Vidhya Navalpakkam},
  journal= {arXiv preprint arXiv:2312.10175},
  year   = {2024}
}

备注

NeurIPS 2024