利用时序信息检测视频中的对话群体并预测下一位发言者
计算机视觉与模式识别
2024-08-30 v1
摘要
人类互动研究提出了 F 形构型概念,用于描述社交互动中参与者的空间布局。本文旨两个目标:一是检测视频序列中的 F 形构型,二是预测群体对话中的下一位发言者。该方法利用视频序列中的时间信息和人类多模态信号。具体而言,我们以衡量个体参与程度作为群体归属的特征。本方法采用长短期记忆网络(LSTM)来预测对话群体中谁会轮到发言。实验在 MatchNMingle 数据集上实现了 85% 的真阳性率(组检测)和 98% 的准确率(预测下一位发言者)。
引用
@article{arxiv.2408.16380,
title = {Exploiting temporal information to detect conversational groups in videos and predict the next speaker},
author = {Lucrezia Tosato and Victor Fortier and Isabelle Bloch and Catherine Pelachaud},
journal= {arXiv preprint arXiv:2408.16380},
year = {2024}
}
备注
Accepted to Pattern Recognition Letter, 8 pages, 10 figures