中文

超越外观:基于 Transformer 的对话动态人物识别

计算机视觉与模式识别 2025-10-07 v1

摘要

本文探讨了 Transformer 架构在自然面对面对话场景下进行人物识别的性能。我们实现并评估了一个双流框架,分别建模 133 个 COCO WholeBody 关键点的空间配置和时间运动模式,从 CANDOR 对话语料库中提取这些关键点。我们的实验比较了预训练模型和从头训练, investigation of velocity features 的使用,并引入了多尺度时间 Transformer 进行层次化运动建模。结果表明,领域特定的训练显著优于迁移学习,空间配置比时间动态携带更具判别性。空间 Transformer 实现了 95.74% 的准确率,而多尺度时间 Transformer 实现了 93.90%。特征级融合将性能提升至 98.03%,证明姿态和动态信息是互补的。这些发现凸显了 Transformer 架构在自然交互中进行人物识别的潜力,并为未来的多模态和跨文化研究提供了见解。

关键词

引用

@article{arxiv.2510.04753,
  title  = {Beyond Appearance: Transformer-based Person Identification from Conversational Dynamics},
  author = {Masoumeh Chapariniya and Teodora Vukovic and Sarah Ebling and Volker Dellwo},
  journal= {arXiv preprint arXiv:2510.04753},
  year   = {2025}
}