中文

CT-Agent:用于 3D CT 影像问答的多模态 LLM 智能体

计算机视觉与模式识别 2025-05-23 v1

摘要

CT 扫描产生可视为数百个横断面图像(即切片)的 3D 体积医学数据,提供详细的解剖信息以用于诊断。对于放射科医生而言,创建 CT 影像报告耗时且容易出错。迫切需要一种视觉问答 (VQA) 系统,能够回答放射科医生关于 CT 扫描中某些解剖区域的问题,甚至自动生成放射科报告。然而,现有 VQA 系统无法充分处理 CT 影像问答 (CTQA) 任务,因为:(1)解剖复杂性使 CT 图像难以理解;(2)跨数百切片的空间关系难以捕获。为此,本文提出 CT-Agent,一种用于 CTQA 的多模态智能体框架。CT-Agent 采用解剖独立工具以分解解剖复杂性;此外,它通过全局-局部 token 压缩策略高效捕获跨切片的空间关系。在两个 3D 胸部 CT 数据集(CT-RATE 和 RadGenome-ChestCT)上的实验结果验证了 CT-Agent 的卓越性能。

关键词

引用

@article{arxiv.2505.16229,
  title  = {CT-Agent: A Multimodal-LLM Agent for 3D CT Radiology Question Answering},
  author = {Yuren Mao and Wenyi Xu and Yuyang Qin and Yunjun Gao},
  journal= {arXiv preprint arXiv:2505.16229},
  year   = {2025}
}