基于可变帧数的CNNLSTM用于乳腺结节超声视频分类
计算机视觉与模式识别
2025-02-18 v1 人工智能
摘要
医学影像与人工智能的交叉一直是智能医疗领域的重要研究方向,尤其是以深度学习分析医学影像进行临床诊断。尽管已有进展,但现有关键帧分类方法缺乏对时序特征的提取,而基于三维卷积的超声视频分类要求不同患者间帧数一致,导致特征提取效率低下和模型分类性能不佳。本研究提出一种基于CNN和LSTM的新型视频分类方法,首次将NLP的长短期记忆(LSTM)方案引入视频分类。该方法将CNN提取的图像特征降维至1x512维,然后按患者视频帧数排序并压缩特征向量以供LSTM训练。具体而言,对特征向量按患者视频帧数排序后填充值为0,以形成可变批量,在LSTM训练前压缩无效填充值以节省计算资源。实验结果表明,我们的可变帧CNNLSTM方法在所有指标上均优于其他方法,在F1分数上提升3%-6%,在特异度上提升1.5%。可变帧CNNLSTM在准确率和精确度方面也优于等帧CNNLSTM。这些发现验证了该方法在分类可变帧数超声视频方面的有效性,并提示其在其他医学影像模态中也有潜在应用前景。
引用
@article{arxiv.2502.11481,
title = {Variable-frame CNNLSTM for Breast Nodule Classification using Ultrasound Videos},
author = {Xiangxiang Cui and Zhongyu Li and Xiayue Fan and Peng Huang and Ying Wang and Meng Yang and Shi Chang and Jihua Zhu},
journal= {arXiv preprint arXiv:2502.11481},
year = {2025}
}