医学动作评估的多变量高斯表示学习
计算机视觉与模式识别
2025-12-02 v2 人工智能
摘要
医学视觉中的细粒度动作评估面临数据集全网缺失、精确度严苛要求及对极快动作时空动态建模不足等独特挑战。为支持开发与评估,本文引入 CPREval-6k——一个包含6,372段专家标注视频及22个临床标签的多视角、多标签医学动作基准数据集。基于该数据集,本文提出 GaussMedAct——一种多变量高斯编码框架,用于通过自适应时空表示学习推进医学动作分析。多变量高斯表示将联合运动映射到时空比例多维空间,动作被分解为自适应3D高斯标记。这些标记通过各向异性协方差建模保留运动语义,同时对时空噪声具备鲁棒性。混合空间编码采用笛卡尔坐标与向量双流策略,有效利用以关节与骨骼特征形式呈现的骨骼信息。该方法在基准数据集上实现92.1%的Top-1准确率,实时推理性能出色,仅用10%的FLOPs即可超越基线+5.9%的准确率。跨数据集实验确认了该方法在鲁棒性方面的优势。
引用
@article{arxiv.2511.10060,
title = {Multivariate Gaussian Representation Learning for Medical Action Evaluation},
author = {Luming Yang and Haoxian Liu and Siqing Li and Alper Yilmaz},
journal= {arXiv preprint arXiv:2511.10060},
year = {2025}
}
备注
Accepted to AAAI 2026