大型语言模型用于癌症沟通:评估生成式 AI 中的语言质量、安全性与可及性
计算与语言
2025-05-19 v1 人工智能
人机交互
机器学习
摘要
关于乳腺癌和宫颈癌的有效沟通仍然是一个持续的健康挑战,由于公众对癌症预防、筛查和治疗存在重大认识不足,可能导致诊断延迟和不充分的治疗。本研究评估了大型语言模型(LLM)在生成准确、安全且易于理解的癌症相关信息方面的能力与局限性,以支持患者理解。我们采用混合方法评估框架,对五个通用型和三个医学型 LLM 进行评估,涵盖语言质量、安全可信度以及沟通可及性和情感表达。我们的方法运用了定量指标、定性专家评分以及 Welch's ANOVA、Games-Howell 和 Hedges' g 的统计分析。结果显示,通用型 LLM 在语言质量和情感表达方面表现更佳,而医学型 LLM 在沟通可及性方面更优。然而,医学型 LLM 往往表现出更高的潜在伤害、毒性和偏见,降低了其在安全性和可信度方面的表现。我们的发现表明,领域特定知识与健康沟通安全性之间存在这种对立。结果凸显了需要针对性模型设计,以特别改善减轻伤害和偏见、提高安全性和情感表达方面的能力。这项研究为癌症沟通领域的 LLM 综合评估提供了全面分析,为改进 AI 生成的健康内容并为未来开发准确、安全、易于访问的数字健康工具提供了关键见解。
引用
@article{arxiv.2505.10472,
title = {Large Language Models for Cancer Communication: Evaluating Linguistic Quality, Safety, and Accessibility in Generative AI},
author = {Agnik Saha and Victoria Churchill and Anny D. Rodriguez and Ugur Kursuncu and Muhammed Y. Idris},
journal= {arXiv preprint arXiv:2505.10472},
year = {2025}
}