中文

模块化深度学习框架用于辅助感知:注视、情感与说话人识别

计算机视觉与模式识别 2025-11-26 v1 机器学习

摘要

开发全面的辅助技术需要实现视觉与听觉感知的无缝集成。本研究评估了受'Smart Eye'等感知系统核心功能启发的模块化架构可行性。我们提出并基准测试了三个独立的感知模块:用于眼状态检测(睡眠/注意)的卷积神经网络(CNN),用于面部表情识别的深度CNN,以及用于语音-based 说话人识别的长短期记忆网络(LSTM)。利用眼睛图像、FER2013和定制音频数据集, our 模型分别实现了93.0%、97.8%和96.89%的准确率。该研究表明,轻量级、领域特定的模型可在离散任务上实现高保真度,为未来在资源受限的辅助设备上实现实时、多模态集成奠定了经过验证的基础。

关键词

引用

@article{arxiv.2511.20474,
  title  = {Modular Deep Learning Framework for Assistive Perception: Gaze, Affect, and Speaker Identification},
  author = {Akshit Pramod Anchan and Jewelith Thomas and Sritama Roy},
  journal= {arXiv preprint arXiv:2511.20474},
  year   = {2025}
}

备注

10 pages, 9 figures, and 3 tables