ACE-$M^3$:多模态医学模型的自动能力评估器
计算与语言
2024-12-17 v1 人工智能
摘要
随着多模态大语言模型(MLLMs)在医疗领域的重要性日益凸显,对其有效性进行精确评估的方法需求变得至关重要。虽然基准测试为评估 MLLMs 的能力提供了可靠手段,但用于开放域评估的传统指标(如 ROUGE 和 BLEU)仅关注词元重叠,可能不符合人类判断。尽管人工评估更为可靠,但其费时、费力且难以扩展。基于 LLM 的评估方法已被证明具有前景,但迄今为止,医疗领域仍急需开源的基于多模态 LLM 的评估器。为了解决这一问题,我们引入了 ACE-,这是一个开源的**M**ultimodal **M**edical **M**odels **A**utomatic **C**apability **E**valuator,专门设计用于评估医疗 MLLMs 的问答能力。它首先利用分支-合并架构,基于标准医学评估标准提供详细的分析和简洁的最终评分。随后,引入了基于奖励词元的直接偏好优化(RTDPO)策略,以在不影响模型性能的情况下节省训练时间。大量实验证明了我们的 ACE- 模型在评估医疗 MLLMs 能力方面的有效性。
引用
@article{arxiv.2412.11453,
title = {ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models},
author = {Xiechi Zhang and Shunfan Zheng and Linlin Wang and Gerard de Melo and Zhu Cao and Xiaoling Wang and Liang He},
journal= {arXiv preprint arXiv:2412.11453},
year = {2024}
}