中文

多人对话中人体行为分析的数据增强方法

计算机视觉与模式识别 2023-08-04 v1

摘要

本文介绍我们 HFUT-VUT 团队在 ACM Multimedia 2023 的 MultiMediate Grand Challenge 2023 中的解决方案。该方案涵盖三个子挑战:身体行为识别、眼神接触检测与下一说话人预测。我们选取 Swin Transformer 作为基线,并利用数据增强策略处理上述三项任务。具体地,我们对原始视频进行裁剪以去除其他部分带来的噪声。同时,我们利用数据增强提升模型泛化能力。结果表明,我们的方案在身体行为识别上以平均精度均值取得 0.6262 的最佳结果,在对应测试集上以准确率 0.7771 完成眼神接触检测。此外,我们的方法在下一说话人预测上以未加权平均召回率取得 0.5281 的相当结果。

关键词

引用

@article{arxiv.2308.01526,
  title  = {Data Augmentation for Human Behavior Analysis in Multi-Person Conversations},
  author = {Kun Li and Dan Guo and Guoliang Chen and Feiyang Liu and Meng Wang},
  journal= {arXiv preprint arXiv:2308.01526},
  year   = {2023}
}

备注

Solutions of HFUT-VUT Team at the ACM MM 2023 Grand Challenge (MultiMediate: Multi-modal Behaviour Analysis for Artificial Mediation). Accepted at ACM MM 2023