释放视频语言模型以实现精细化 HRCT 报告生成
计算机视觉与模式识别
2026-03-24 v2
摘要
从高分辨率断层扫描(HRCT)生成精确诊断报告对于临床工作流程至关重要,但由于 3D 体积中病理学多样性和空间稀疏性,该任务仍具挑战性。尽管视频语言模型(VideoLMs)在一般领域已展示出卓越的时空推理能力,但其针对特定领域、高容量医学解读的可迁移性仍未得到充分探索。本文提出 AbSteering,一个以异常为中心的框架,用于引导 VideoLMs 实现精确的 HRCT 报告生成。具体而言,AbSteering 引入:(i)一种以异常为中心的链式思考方案,用于强制执行异常推理;(ii)一种直接偏好优化目标,利用临床易混淆异常作为硬性负样本以增强细粒度判别。我们的结果表明,通用 VideoLMs 在该范式指导下具有强大的迁移能力,可应用于高容量医学影像。值得注意的是,AbSteering 在多个方面均优于最先进的领域特定 CT 基础模型——这些模型使用大规模 CT 数据进行预训练——实现检测灵敏度提升的同时显著减轻幻觉现象。
引用
@article{arxiv.2603.12469,
title = {Unleashing Video Language Models for Fine-grained HRCT Report Generation},
author = {Yingying Fang and Huichi Zhou and KinHei Lee and Yijia Wang and Zhenxuan Zhang and Jiahao Huang and Guang Yang},
journal= {arXiv preprint arXiv:2603.12469},
year = {2026}
}