大型语言模型在医学咨询中的伦理风险:基于生殖伦理的评估
计算机与社会
2026-02-02 v1
摘要
背景:随着大型语言模型(LLMs)在医疗和医学咨询场景中日益广泛应用,日益引起担忧的是,这些模型能否以符合伦理规范的方式回应医学疑问——尤其是符合当地伦理标准。为应对这一迫切需要,对可靠性和安全性进行全面研究的要求,我们系统评估了LLMs在解答与生殖伦理相关问题方面的性能,具体考察其与中国伦理法规的一致性。方法:我们对八个知名LLMs(如GPT-4、Claude-3.7)进行评估,构建了包含986个问题(906个主观性、80个客观性)的测试集,这些问题源自中国生殖伦理法规的168篇文献。对主观性回应采用一种新颖的六维评分标准进行评估,考察安全性(规范合规性、指导安全性)和答案质量(问题识别、引用、建议、同情心)。结果:发现安全问题普遍存在,针对不安全或误导性建议的风险率达到29.91%。所有模型在引用规范来源和表达同情心方面普遍表现不佳。我们还发现了道德推理异常的实例,包括逻辑自矛盾和违背基本道德直觉的响应。结论:当前LLMs不可靠且不安全,可用于自主生殖伦理咨询。尽管具有知识回顾能力,但在安全性、逻辑一致性和必需的人文技能方面存在关键缺陷。这些发现为 cautionary note(警示性警告)提供了关键依据,呼吁未来开发优先考虑稳健的推理、规范论证和同情心。
引用
@article{arxiv.2601.22621,
title = {Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics},
author = {Hanhui Xu and Jiacheng Ji and Haoan Jin and Han Ying and Mengyue Wu},
journal= {arXiv preprint arXiv:2601.22621},
year = {2026}
}