中文

基于动作捕捉图像的 Vision Transformer、卷积和混合架构 for 精神健康分类的比较分析

计算机视觉与模式识别 2025-12-02 v1 机器学习

摘要

本工作检验了三种不同基于图像的方法——VGG16、ViT-B/16 和 CoAtNet-Tiny——在识别抑郁、精神分裂症和健康对照人群方面的性能。来自 Psykose 和 Depresjon 数据集的手腕佩戴的活动信号被转换为 30 乘 48 的图像,并通过三折的主体划分进行评估。尽管所有方法在训练数据上都表现良好,但在未见数据上的表现存在差异。VGG16 的准确率呈稳步提升,但常常在较低水平停滞。ViT-B/16 在某些运行中取得强劲结果,但其性能在不同折数之间有显著波动。CoAtNet-Tiny 表现最为可靠,记录了最高的平均准确率和跨折数的最稳定曲线。它还产生了最强的精确率、召回率和 F1 分数,尤其针对欠representer 的抑郁和精神分裂症类别。总体而言,发现 CoAtNet-Tiny 在动作捕捉图像上表现最为一致,而 VGG16 和 ViT-B/16 产生了混合结果。这些观察表明,某些混合设计可能特别适合依赖于动作捕捉派生图像的精神健康领域。

关键词

引用

@article{arxiv.2512.00103,
  title  = {Comparative Analysis of Vision Transformer, Convolutional, and Hybrid Architectures for Mental Health Classification Using Actigraphy-Derived Images},
  author = {Ifeanyi Okala},
  journal= {arXiv preprint arXiv:2512.00103},
  year   = {2025}
}