生成式AI能否满足患者与护理者的信息需求?面向以任务为中心的AI系统评估
人机交互
2025-03-03 v2 人工智能
计算与语言
机器学习
摘要
诸如ChatGPT和Claude等生成式AI系统建立在语言模型之上,这些模型通常在精选的基准数据集上评估准确性。此类评估范式衡量语言模型的预测和推理能力,但不评估它们是否能提供对人们有用的信息。在本文中,我们在开发以人类理解和决策为中心的评估范式方面迈出了初步步伐。我们研究生成式AI系统在支持人们完成具体任务方面的效用——理解临床报告和影像以做出临床决策。我们进行了一项形成性需求发现研究,参与者在其中与心胸放射科医师讨论了一位虚构近亲的胸部计算机断层扫描(CT)及相关放射学报告。使用对参与者与医学专家之间对话的主题分析,我们识别了交互中常见的主题,包括澄清医学术语、在扫描图像中定位报告提及的问题、了解疾病预后、讨论下一步诊断步骤以及比较治疗方案。基于这些主题,我们对照放射科医师的回答评估了两个最先进的生成式AI系统。我们的结果揭示了模型在不同主题上生成响应质量的变异性。我们强调面向患者的生成式AI系统适应多样化对话主题的重要性,以满足患者现实世界的信息需求。
引用
@article{arxiv.2402.00234,
title = {Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems},
author = {Shreya Rajagopal and Jae Ho Sohn and Hari Subramonyam and Shiwali Mohan},
journal= {arXiv preprint arXiv:2402.00234},
year = {2025}
}