通过多面向自我完善学习提升LLM的医学情境感知能力
人工智能
2025-11-17 v2 计算与语言
摘要
大语言模型(LLMs)在医学领域展现出巨大潜力,在多个基准上取得优异性能,但在实际医学场景中仍表现不足,这些场景往往需要更强的情境感知能力,即识别缺失或关键细节(如用户身份、病史、风险因素)并提供安全、有帮助且情境恰当的响应。为此,我们提出多面向自我完善学习(Multifaceted Self-Refinement, MuSeR),通过自我评估和自我完善提升LLM在三个关键维度(决策、沟通和安全)上的情境感知能力。具体做法是首先设计属性条件查询生成器,通过变化属性(如角色、地理区域、意图和信息模糊程度)模拟多样化的真实用户情境。LLM随后针对这些查询作出响应,沿三个关键维度自我评估答案,并对响应进行完善以更贴合各维度要求。最后,使用这些查询和完善后的响应进行监督式微调,以强化模型的情境感知能力。在最新的HealthBench数据集上进行评估,结果表明该方法在多个方面显著提升LLM性能,尤其在情境感知轴上取得显著提升。进一步采用知识蒸馏,较小的底层LLM(如Qwen3-32B)的性能可超越其教师模型,在HealthBench(63.8%)及其困难子集(43.1%)上实现全新SOTA。代码和数据集将在https://muser-llm.github.io发布。
关键词
引用
@article{arxiv.2511.10067,
title = {Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning},
author = {Yuxuan Zhou and Yubin Wang and Bin Wang and Chen Ning and Xien Liu and Ji Wu and Jianye Hao},
journal= {arXiv preprint arXiv:2511.10067},
year = {2025}
}
备注
20 pages, 13 figures