医疗聊天机器人对话中症状模式的文本挖掘分析
机器学习
2025-12-02 v1 计算与语言
信息检索
摘要
数字健康系统的快速发展导致人们迫切需要更好地理解这些系统如何解释和表示患者报告的症状。聊天机器人已被用于提供临床支持和提升用户体验,使得通过聊天机器人从基于文本的数据中提供有意义的临床模式成为可能。该研究利用多种自然语言处理方法来研究症状描述的发生情况以及这些对话中所暴露的模式。通过使用 Medical Conversations to Disease Dataset——包含 960 轮多轮对话并分为 24 种临床病情的数据集,我们为进一步的计算分析创建了一个标准化的患者与机器人之间的对话表示。该多方法方法使用多种工具,包括潜在狄利克雷分配(LDA)来识别潜在症状主题、K 均值聚类来按相似性对症状描述进行分组、基于 Transformer 的命名实体识别(NER)来提取医学概念,以及 Apriori 算法来发现频繁的症状配对。分析结果表明,临床相关主题呈现出一致的结构,聚类凝聚程度适中,且症状如发热头痛和皮疹瘙痛等之间的关系具有较高的置信水平。这些结果支持将对话式医疗数据作为早期症状解释的有价值诊断信号,以强化决策支持并改进用户与远程健康技术的交互方式。通过展示将非结构化自由形式对话转换为有关症状的可操作知识的方法,本工作为进一步提升未来性能、可靠性和临床实用性提供了可扩展框架,以改进选择医疗聊天机器人。
引用
@article{arxiv.2512.00768,
title = {Text Mining Analysis of Symptom Patterns in Medical Chatbot Conversations},
author = {Hamed Razavi},
journal= {arXiv preprint arXiv:2512.00768},
year = {2025}
}
备注
9 pages, 4 tables