中文

VICSOM:来自社交媒体的视觉线索用于心理评估

计算机视觉与模式识别 2019-05-16 v1 计算机与社会 社会与信息网络

摘要

在社交网站(SNS)中分享多模态信息(通常为图像、视频或文本)占据了我们相当多的时间。用户在SNS中展现自我的特定方式可提供推断人类行为的有用信息。本文提出使用从Instagram账户收集的多模态数据来预测Glasser选择理论中所描述的感知原型需求。贡献有两点:(i)我们提供了一个来自Instagram公开档案的大型多模态数据库(超过30,000张图像与文本标题),由专业心理学家依据Glasser理论对每种感知行为进行标注;(ii)我们提出自动化识别用户(无意识)感知到的需求。特别地,我们提出使用三种不同特征集的基线:基于像素图像的视觉描述子(SURF与视觉词袋)、基于使用卷积神经网络(Convolutional Neural Networks)的自动化场景描述的高层描述子,以及通过对用户提供的标题进行处理得到的基于文本的描述子(Word2vec)。最后,我们提出这些描述子的多模态融合,在多标签分类问题中获得了有前景的结果。

关键词

引用

@article{arxiv.1905.06203,
  title  = {VICSOM: VIsual Clues from SOcial Media for psychological assessment},
  author = {Mohammad Mahdi Dehshibi and Gerard Pons and Bita Baiani and David Masip},
  journal= {arXiv preprint arXiv:1905.06203},
  year   = {2019}
}