中文

利用大语言模型高效生成用于犬类肌肉骨骼诊断的视觉数据

计算机视觉与模式识别 2025-09-17 v1

摘要

众所周知,更多的数据通常能提升人工智能模型的性能。然而,对于某些任务,由于事件罕见或成本高昂,数据收集可能颇具挑战。这些挑战在我们的用例中尤为明显,我们应用人工智能模型以一种新颖方法对犬类的肌肉骨骼状况进行视觉记录。在此方法中,异常以彩色笔触标记在犬类身体图谱上。由于这些笔触对应着不同的肌肉或关节,它们可以被映射到大语言模型(LLMs)运作的文本域。大语言模型在包括医疗应用在内的广泛任务中展现了令人印象深刻的能力,为生成合成训练数据提供了巨大潜力。在本工作中,我们研究了大语言模型是否能有效生成用于犬类肌肉骨骼诊断的合成视觉训练数据。为此,我们开发了一种映射方法,将视觉记录分割成超过200个代表肌肉或关节的标记区域。利用引导解码、思维链推理和少样本提示等技术,我们为髌骨脱位(膝盖骨脱位)诊断生成了1000份合成视觉记录,这是我们拥有最多真实世界数据的诊断类型。我们的分析表明,生成的记录对诊断的位置和严重程度敏感,同时与犬的性别无关。我们进一步为各种其他诊断生成了1000份视觉记录,以创建一个二分类数据集。仅在此合成数据上训练的模型在70份真实世界记录上取得了88%的F1分数。这些结果展示了大语言模型生成合成数据的潜力,这对于解决罕见病的数据稀缺问题尤其有价值。虽然我们的方法是针对医疗领域定制的,但其见解和技术可以适应其他领域。

关键词

引用

@article{arxiv.2509.12866,
  title  = {Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses},
  author = {Martin Thißen and Thi Ngoc Diep Tran and Barbara Esteve Ratsch and Ben Joel Schönbein and Ute Trapp and Beate Egner and Romana Piat and Elke Hergenröther},
  journal= {arXiv preprint arXiv:2509.12866},
  year   = {2025}
}