VICSOM:来自社交媒体的视觉线索用于心理评估
计算机视觉与模式识别
2019-05-16 v1 计算机与社会
社会与信息网络
摘要
在社交网站(SNS)中分享多模态信息(通常为图像、视频或文本)占据了我们相当多的时间。用户在SNS中展现自我的特定方式可提供推断人类行为的有用信息。本文提出使用从Instagram账户收集的多模态数据来预测Glasser选择理论中所描述的感知原型需求。贡献有两点:(i)我们提供了一个来自Instagram公开档案的大型多模态数据库(超过30,000张图像与文本标题),由专业心理学家依据Glasser理论对每种感知行为进行标注;(ii)我们提出自动化识别用户(无意识)感知到的需求。特别地,我们提出使用三种不同特征集的基线:基于像素图像的视觉描述子(SURF与视觉词袋)、基于使用卷积神经网络(Convolutional Neural Networks)的自动化场景描述的高层描述子,以及通过对用户提供的标题进行处理得到的基于文本的描述子(Word2vec)。最后,我们提出这些描述子的多模态融合,在多标签分类问题中获得了有前景的结果。
引用
@article{arxiv.1905.06203,
title = {VICSOM: VIsual Clues from SOcial Media for psychological assessment},
author = {Mohammad Mahdi Dehshibi and Gerard Pons and Bita Baiani and David Masip},
journal= {arXiv preprint arXiv:1905.06203},
year = {2019}
}