基于LLM的医疗评估中细粒度对齐的分层分治法
计算与语言
2025-01-14 v1
摘要
在快速发展的用于医疗应用的大语言模型(LLMs)领域,确保这些模型在临床环境中的可靠性和准确性至关重要。现有的基准通常关注如多项选择题等固定格式的任务,这无法捕捉真实世界临床诊断的复杂性。此外,传统评估指标和基于LLM的评估器存在不对齐问题,通常提供过于简化的评估,无法充分反映人类判断。为了应对这些挑战,我们引入了HDCEval,一个为医疗评估中细粒度对齐量身定制的分层分治评估框架。HDCEval建立在与专业医生合作开发的一组细粒度医疗评估指南之上,涵盖患者问题相关性、医学知识正确性和表达。该框架将复杂的评估任务分解为专门的子任务,每个子任务由通过属性驱动的Token优化(ADTO)在精心策划的偏好数据集上训练的专家模型进行评估。这种分层方法确保了评估的各个方面都能得到专家级的精确处理,从而显著改善了与人类评估者的对齐。
引用
@article{arxiv.2501.06741,
title = {Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation},
author = {Shunfan Zheng and Xiechi Zhang and Gerard de Melo and Xiaoling Wang and Linlin Wang},
journal= {arXiv preprint arXiv:2501.06741},
year = {2025}
}