Quark 医学对齐:多维度综合对齐与协作优化范式
人工智能
2026-03-03 v2
摘要
尽管近年来强化学习在大型语言模型对齐方面取得了快速进展,但将这些范式迁移到高风险医学问答领域,却发现了根本性的范式差异。基于人类反馈的强化学习依赖偏好标注,这些标注成本高昂且往往未能反映医学事实的绝对正确性。基于可验证奖励的强化学习缺乏有效的自动验证器,且难以处理复杂的临床情境。此外,医学对齐需要同时优化正确性、安全性和合规性,但多目标异构奖励信号容易出现尺度不匹配和优化冲突。为此,我们提出一种健壮的医学对齐范式。首先,我们构建了多维度医学对齐矩阵,将对齐目标分解为四个类别:基本能力、专家知识、在线反馈和格式规范。在每个类别内部,我们建立了一套闭环:可观测指标指导可归因诊断,进而驱动可优化奖励,从而为后续迭代优化提供细粒度、高分辨率的监督信号。为解决异构信号导致的梯度支配和优化不稳定问题,我们进一步提出了统一优化机制。该机制采用参考冻结归一化来对齐奖励尺度,并实施三因素自适应动态加权策略,以实现面向弱点、风险优先、冗余减少的协作优化。实验结果表明,我们提出的范式在真实世界医学场景评估中有效,确立了垂直领域复杂对齐的新范式。
引用
@article{arxiv.2602.11661,
title = {Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm},
author = {Tianxiang Xu and Jiayi Liu and Yixuan Tong and Jialu Xu and Yunqing Wei and Kaiwen Feng and PanPan Hou and Kangping Yin and Jiyuan Hu and Hao Zhou and Zhenxin Ma and Jian Xu and Guanjun Jiang},
journal= {arXiv preprint arXiv:2602.11661},
year = {2026}
}