中文

基于光流表示对齐的医学视频生成 Mamba 扩散模型

计算机视觉与模式识别 2024-11-05 v1 人工智能

摘要

医学视频生成模型有望在医疗保健行业产生深远影响,包括但不限于医学教育与培训、手术规划与模拟。当前视频扩散模型通常基于图像扩散架构,通过引入时序操作(如 3D 卷积和时序注意力)来实现。虽然这种方法有效,但其简化处理限制了时空性能并消耗大量计算资源。为此,我们提出了医学模拟视频生成器(MedSora),其包含三个关键要素:i) 视频扩散框架整合了注意力与 Mamba 的优势,在低计算负载与高质量视频生成之间取得平衡;ii) 光流表示对齐方法在隐式增强对帧间像素的注意力;iii) 带频率补偿的视频变分自编码器(VAE)解决了将像素空间转化为潜在特征再返回像素帧时医学特征丢失的问题。大量实验与应用表明,MedSora 在生成医学视频方面表现出优异的视觉质量,超越了最先进的基线方法。进一步的结果与代码已于 https://wongzbb.github.io/MedSora 提供。

关键词

引用

@article{arxiv.2411.01647,
  title  = {Optical Flow Representation Alignment Mamba Diffusion Model for Medical Video Generation},
  author = {Zhenbin Wang and Lei Zhang and Lituan Wang and Minjuan Zhu and Zhenwei Zhang},
  journal= {arXiv preprint arXiv:2411.01647},
  year   = {2024}
}