中文

「What's Up, Doc?」:分析大规模对话式 AI 数据集中用户寻求健康信息的方式

计算与语言 2025-09-23 v3 人工智能 计算机与社会

摘要

人们越来越多地通过交互式聊天机器人从大型语言模型(LLM)获取医疗信息,但这些对话的性质及其固有的风险仍然鲜有探讨。本文我们通过筛选大规模对话式 AI 数据集,构建 HealthChat-11K 数据集,这是一个包含 11K 条真实世界对话、25K 条用户消息的精选数据集。我们运用 HealthChat-11K 以及由临床医生制定的用户与 LLM 交互方式分类法,系统研究用户在 21 个不同医疗专科寻求医疗信息时的交互方式。我们的分析揭示了用户如何和为何寻求医疗信息的洞见,例如常见的交互模式、上下文不完整的情况、情感行为,以及可能引发迎合现象(如引导性问题)的交互方式,凸显了需要提升作为对话式 AI 部署的 LLM 在医疗支持方面的能力。可在此处找到用于检索我们分析结果并构建精选数据集的代码和数据集:https://github.com/yahskapar/HealthChat

引用

@article{arxiv.2506.21532,
  title  = {"What's Up, Doc?": Analyzing How Users Seek Health Information in Large-Scale Conversational AI Datasets},
  author = {Akshay Paruchuri and Maryam Aziz and Rohit Vartak and Ayman Ali and Best Uchehara and Xin Liu and Ishan Chatterjee and Monica Agrawal},
  journal= {arXiv preprint arXiv:2506.21532},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings - 25 pages, 6 figures, 4 tables