中文

支持产科护理的聊天机器人开发与评估

人工智能 2026-03-16 v1 计算与语言 信息检索

摘要

在低资源环境中,用户健康素养低且获取护理有限时,使用电话聊天机器人提供可信赖的产科健康信息具有重要影响。然而,在技术上部署此类系统具有挑战:用户查询简短、表述模糊,跨语言代码混合,答案需要基于区域背景信息,且部分或缺失的症状背景使安全路由决策困难。我们随一位医院合作开发了印度的产科聊天机器人。该系统结合了(1)阶段感知分流,将高风险查询路由到专家模板;(2)针对精选产科/新生儿指南的混合检索;(3)来自大语言模型(LLM)的证据条件生成。我们的核心贡献是针对有限专家监督下的高风险部署的评估工作流程。针对组件级和端到端测试,我们引入了:(i)标记的分流基准(N=150),实现86.7%的紧急情况召回率,显式报告漏检紧急情况与过度升级的权衡;(ii)带块级证据标签的合成多证据检索基准(N=100);(iii)基于临床医生设计准则的真实查询LLM评判(N=781);(iv)专家验证。我们的发现表明,多语言、嘈杂环境中的可信医疗助手需要配合防御性设计和多方法评估,而非单一模型和评估方法选择。

关键词

引用

@article{arxiv.2603.13168,
  title  = {Developing and evaluating a chatbot to support maternal health care},
  author = {Smriti Jha and Vidhi Jain and Jianyu Xu and Grace Liu and Sowmya Ramesh and Jitender Nagpal and Gretchen Chapman and Benjamin Bellows and Siddhartha Goyal and Aarti Singh and Bryan Wilder},
  journal= {arXiv preprint arXiv:2603.13168},
  year   = {2026}
}

备注

17 pages; submitted to IJCAI 2026 AI and Social Good Track