中文

现实场景治疗中的松散社交互动识别

计算机视觉与模式识别 2024-10-30 v1

摘要

计算机视觉领域已探索双人互动以处理原子动作,如推物、搬运物品等。然而,随着深度学习模型的发展,亟需探索更复杂的双人情境,如松散互动。这些互动是指两个人独立地执行某些原子活动以完成全局动作,无需时间同步或物理交互,例如共同烹饪。分析此类双人互动在医学领域对社交技能发展和心理健康诊断具有多种有用应用。为实现此目标,我们提出了一种新颖的双路径体系结构来捕获两个人的松散互动。我们的模型通过CNN主干学习每个流的全局抽象特征,并使用基于交叉注意力策略的新Global-Layer-Attention模块进行融合。我们在现实自闭症诊断数据集(即我们的Loose-Interaction数据集)以及公开的自闭症数据集上评估了我们的模型。在Loose-Interaction和Autism数据集上,我们的网络分别实现了基准和SOTA结果。此外,我们在公开数据集NTU-RGB+D上进行实验(来自NTU-60和NTU-120的交互类别),发现不同互动需要不同的网络设计。我们还比较了稍微不同版本的方法,通过纳入时间信息来处理紧密互动,实现了SOTA结果。

关键词

引用

@article{arxiv.2409.20270,
  title  = {Loose Social-Interaction Recognition in Real-world Therapy Scenarios},
  author = {Abid Ali and Rui Dai and Ashish Marisetty and Guillaume Astruc and Monique Thonnat and Jean-Marc Odobez and Susanne Thümmler and Francois Bremond},
  journal= {arXiv preprint arXiv:2409.20270},
  year   = {2024}
}