超越外观:基于 Transformer 的对话动态人物识别
计算机视觉与模式识别
2025-10-07 v1
摘要
本文探讨了 Transformer 架构在自然面对面对话场景下进行人物识别的性能。我们实现并评估了一个双流框架,分别建模 133 个 COCO WholeBody 关键点的空间配置和时间运动模式,从 CANDOR 对话语料库中提取这些关键点。我们的实验比较了预训练模型和从头训练, investigation of velocity features 的使用,并引入了多尺度时间 Transformer 进行层次化运动建模。结果表明,领域特定的训练显著优于迁移学习,空间配置比时间动态携带更具判别性。空间 Transformer 实现了 95.74% 的准确率,而多尺度时间 Transformer 实现了 93.90%。特征级融合将性能提升至 98.03%,证明姿态和动态信息是互补的。这些发现凸显了 Transformer 架构在自然交互中进行人物识别的潜力,并为未来的多模态和跨文化研究提供了见解。
引用
@article{arxiv.2510.04753,
title = {Beyond Appearance: Transformer-based Person Identification from Conversational Dynamics},
author = {Masoumeh Chapariniya and Teodora Vukovic and Sarah Ebling and Volker Dellwo},
journal= {arXiv preprint arXiv:2510.04753},
year = {2025}
}