Dyadformer:一种用于二元交互长程建模的多模态 Transformer
计算机视觉与模式识别
2021-09-21 v1 人工智能
机器学习
摘要
由于广泛的应用前景,人格计算已成为计算机视觉中一个新兴话题。然而,该话题上的多数工作聚焦于分析个体,即便应用于交互场景时也如此,且时间跨度较短。为应对这些局限,我们提出 Dyadformer,一种新颖的多模态多主体 Transformer 架构,使用可变时间窗对二元交互中的个体与人际特征建模,从而能够捕捉长期相互依赖关系。我们提出的跨主体层允许网络通过注意力操作显式建模主体间交互。这一概念验证方法展示了多模态与对两名交互者更长时间的联合建模如何有助于预测个体属性。借助 Dyadformer,我们在 UDIVA v0.5 数据集上改进了关于个体的最先进自报告人格推断结果。
引用
@article{arxiv.2109.09487,
title = {Dyadformer: A Multi-modal Transformer for Long-Range Modeling of Dyadic Interactions},
author = {David Curto and Albert Clapés and Javier Selva and Sorina Smeureanu and Julio C. S. Jacques Junior and David Gallardo-Pujol and Georgina Guilera and David Leiva and Thomas B. Moeslund and Sergio Escalera and Cristina Palmero},
journal= {arXiv preprint arXiv:2109.09487},
year = {2021}
}
备注
Accepted to the 2021 ICCV Workshop on Understanding Social Behavior in Dyadic and Small Group Interactions