中文

面向人类参与度估计的对话感知变换器 with Modality-Group Fusion

人机交互 2024-10-14 v1 计算机视觉与模式识别

摘要

参与度估计在理解人类社会行为方面发挥着关键作用,吸引了来自情感计算和人机交互等领域的日益增长的研究关注。本文提出了一种对话感知变换器框架(DAT)with Modality-Group Fusion(MGF),该框架仅依赖于 audio-visual 输入且 language-independent,用于估计对话中人类的参与度。具体而言,本方法采用 modality-group fusion strategy 独立地在每个模态中对每个人的特征进行融合,然后推断整个 audio-visual 内容。该策略显著增强了模型的性能和鲁棒性。此外,为更好地估计目标参与者的参与水平,引入的对话感知变换器考虑了参与者的行为以及来自其对话伙伴的线索。我们的方法在MultiMediate'24举办的 Multi-Domain Engagement Estimation Challenge 中进行了严格测试,在 baseline 模型上实现了显著的参与度回归精度提升。值得注意的是,本方法在 NoXi Base test set 上的 CCC score 为0.76,在 NoXi Base、NoXi-Add和 MPIIGI test sets 上的平均 CCC为0.64。

关键词

引用

@article{arxiv.2410.08470,
  title  = {DAT: Dialogue-Aware Transformer with Modality-Group Fusion for Human Engagement Estimation},
  author = {Jia Li and Yangchen Yu and Yin Chen and Yu Zhang and Peng Jia and Yunbo Xu and Ziqiang Li and Meng Wang and Richang Hong},
  journal= {arXiv preprint arXiv:2410.08470},
  year   = {2024}
}

备注

1st Place on the NoXi Base dataset in the Multi-Domain Engagement Estimation Challenge held by MultiMediate 24, accepted by ACM Multimedia 2024. The source code is available at \url{https://github.com/MSA-LMC/DAT}