中文

面向更年期的大语言模型聊天机器人混合方法评估

计算机与社会 2025-02-07 v1 人机交互

摘要

将大语言模型(LLMs)整合到医疗保健环境中已获得显著关注,特别是在问答任务方面。鉴于医疗保健的高风险性质,确保LLM生成内容的准确性和可靠性以防止不良后果至关重要。然而,稳健评估指标和方法论的开发仍是一个备受争议的问题。我们采用混合方法评估了公开可用的基于LLM的聊天机器人在处理更年期相关查询时的表现,评估维度包括安全性、共识性、客观性、可重复性和可解释性。我们的研究结果凸显了传统评估指标在敏感健康话题上的前景与局限性。我们提出,需要定制化的、基于伦理的评估框架来评估LLMs,以推进其在医疗保健中的安全有效应用。

关键词

引用

@article{arxiv.2502.03579,
  title  = {A Mixed-Methods Evaluation of LLM-Based Chatbots for Menopause},
  author = {Roshini Deva and Manvi S and Jasmine Zhou and Elizabeth Britton Chahine and Agena Davenport-Nicholson and Nadi Nina Kaonga and Selen Bozkurt and Azra Ismail},
  journal= {arXiv preprint arXiv:2502.03579},
  year   = {2025}
}