基于自然对话关键点的人员识别双流时空 Transformer 框架
计算机视觉与模式识别
2025-06-25 v2
摘要
在 AI 驱动的生成技术时代,传统生物特征识别系统面临前所未有的挑战,特别是来自复杂的深度伪造和面部重演技术的挑战。在本研究中,我们提出了一种双流时空 Transformer 框架,用于利用在线对话中可见的上半身关键点(我们称之为对话关键点)进行人员识别。我们的框架通过两个专门的分支处理关键点之间的空间关系及其时间演化:一个空间 Transformer(STR),用于学习关键点配置中的独特结构模式;以及一个时间 Transformer(TTR),用于捕捉序列运动模式。使用最先进的 Sapiens 姿态估计器,我们提取了 133 个关键点(基于 COCO-WholeBody 格式),代表面部特征、头部姿态和手部位置。该框架在 114 名进行自然对话的个体的数据集上进行了评估,空间流的识别准确率为 80.12%,时间流的识别准确率为 63.61%。然后,我们探索了两种融合策略:一种共享损失函数方法达到了 82.22% 的准确率,另一种特征级融合方法将两个流的特征图拼接起来,将性能显著提升至 94.86%。通过联合建模静态解剖关系和动态运动模式,我们的方法学习到了比传统基于外观的方法更防欺骗的全面身份签名。
引用
@article{arxiv.2502.20803,
title = {Two-Stream Spatial-Temporal Transformer Framework for Person Identification via Natural Conversational Keypoints},
author = {Masoumeh Chapariniya and Hossein Ranjbar and Teodora Vukovic and Sarah Ebling and Volker Dellwo},
journal= {arXiv preprint arXiv:2502.20803},
year = {2025}
}
备注
I would like to withdraw this submission due to the need for substantial revisions in the results and analysis. I plan to correct and improve the study and submit a more complete version in the near future