大语言模型在类别决策中对齐有效性的系统性表征
计算与语言
2024-10-01 v1 人工智能
摘要
随着大语言模型(LLMs)被部署在医疗保健等高风险领域,理解其决策与人类偏好和价值观的对齐程度变得至关重要,尤其是当我们认识到这些偏好并不存在单一的金标准时。本文应用了一种系统性方法,以医疗分诊为特定领域用例,评估 LLMs 在类别决策上的偏好对齐。它还衡量了对齐程序在改变特定模型对齐度方面的有效性。该方法的关键在于一种新颖的简单度量——对齐合规指数(Alignment Compliance Index, ACI),用于量化 LLM 能够在多大程度上被对齐到给定的偏好函数或金标准。由于 ACI 衡量的是对齐的效果而非过程,因此它适用于本研究中使用的上下文学习之外的其他对齐方法。使用模拟患者对的数据集,评估了三个前沿 LLMs(GPT4o、Claude 3.5 Sonnet 和 Gemini Advanced)做出与专家临床医生偏好一致的分诊决策的能力。采用各种提示策略评估了模型在对齐尝试前后的性能。结果揭示了不同模型和对齐方法在对齐有效性上的显著差异。值得注意的是,以 ACI 衡量在对齐前表现良好的模型,有时会在对齐后发生退化,且目标偏好函数的微小变化会导致模型排名的大幅变动。本文还通过有针对性的提问,探讨了 LLMs 决策所隐含的、人类所理解的伦理原则。本研究推动了在短期内使用一套实用方法和 ACI,以理解在诸如分诊等类别决策中,各种人类与 LLM 决策价值观之间的对应关系。
引用
@article{arxiv.2409.18995,
title = {Systematic Characterization of the Effectiveness of Alignment in Large Language Models for Categorical Decisions},
author = {Isaac Kohane},
journal= {arXiv preprint arXiv:2409.18995},
year = {2024}
}
备注
19 pages (without Appendix) Appendix 7 pages. 7 Figures