MoColl:基于智能体的图像字幕生成专用与通用模型协作
计算机视觉与模式识别
2025-01-28 v3 人工智能
摘要
图像字幕生成是计算机视觉与自然语言处理交叉领域的一项关键任务,在各个领域具有广泛应用。对于诊断报告生成等复杂任务,深度学习模型不仅需要特定领域的图像-字幕数据集,还需要结合相关通用知识以提供语境准确性。现有方法存在固有局限性:专用模型擅长捕捉领域特定细节但缺乏泛化能力,而基于大型语言模型 (LLMs) 的视觉-语言模型 虽能利用通用知识,却难以进行领域特定适配。为解决这些局限性,本文提出了一种新颖的智能体增强模型协作框架,我们称之为 MoColl,旨在有效整合领域特定知识与通用知识。具体而言,我们的方法是将复杂的图像字幕生成任务分解为一系列相互关联的问答子任务。采用可训练的视觉问答 (VQA) 模型作为专用工具,专注于领域特定视觉分析,基于图像内容回答任务特定问题。同时,具备通用知识的基于 LLM 的智能体负责提出这些问题,并将生成的问答对综合成连贯的字幕。该智能体除了利用 VQA 模型外,还进一步指导其训练以增强其领域特定能力。在放射学报告生成上的实验结果验证了所提框架的有效性,表明生成报告的质量有显著提升。
引用
@article{arxiv.2501.01834,
title = {MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning},
author = {Pu Yang and Bin Dong},
journal= {arXiv preprint arXiv:2501.01834},
year = {2025}
}