中文

延迟墙:面向实时虚拟化身的现成情绪识别基准评测

计算机视觉与模式识别 2026-01-23 v1 人机交互

摘要

在虚拟现实(VR)和人机交互(HCI)领域,实时情绪识别有望帮助自闭症谱系障碍(ASD)患者提升社交技能。该任务需要严格的延迟-准确率权衡,运动到光子(MTP)延迟须保持在 140 毫秒以下以维持交互的即时性。然而,大多数现成的深度学习模型优先考虑准确率,而非商用硬件上的严格时序约束。作为迈向可及 VR 疗法的第一步,我们使用 UIBVFED 数据集,对虚拟角色上的零样本面部表情识别(FER)的当前最优(SOTA)模型进行基准评测。我们评估了用于人脸检测的 YOLO(v8、v11 和 v12)的中型(Medium)和纳米(Nano)变体,以及包括 CLIP、SigLIP 和 ViT-FER 在内的通用视觉Transformer。我们在仅使用 CPU 推理的结果表明,尽管对风格化化身的人脸检测很稳健(100% 准确率),但在分类阶段存在一道“延迟墙”。YOLOv11n 架构为检测提供了最佳平衡(约 54 毫秒)。然而,像 CLIP 和 SigLIP 这样的通用 Transformer 无法在实时循环中达到可行的准确率(<23%)或速度(>150 毫秒)。本研究强调了在治疗环境中实现可及的实时 AI 需要轻量级、领域专用的架构。

关键词

引用

@article{arxiv.2601.15914,
  title  = {The Latency Wall: Benchmarking Off-the-Shelf Emotion Recognition for Real-Time Virtual Avatars},
  author = {Yarin Benyamin},
  journal= {arXiv preprint arXiv:2601.15914},
  year   = {2026}
}

备注

Technical Report benchmarking off-the-shelf CV latencies on commodity CPU hardware for therapeutic VR applications